---
title: "합성 청중 정확도 주장 읽는 법"
description: "합성 연구 공급업체는 85%에서 98% 사이의 정확도 비율을 발표합니다. 그들 중 거의 모두가 같은 것을 측정하지 않습니다. 어떤 주장이 검증 가능한지 판단하는 방법은 다음과 같습니다."
canonical_url: "https://getminds.ai/blog/ko/how-to-read-synthetic-audience-accuracy-claims"
last_updated: "2026-10-02T17:58:43.766Z"
---

# 합성 청중 정확도 주장 읽는 법

합성 연구 공급업체는 85%에서 98% 사이의 정확도 수치를 발표합니다. 빠르게 읽으면, 이 분야는 정착된 것처럼 보이고 차이는 작아 보입니다.

그러나 이들은 비교할 수 없습니다. 비율은 서로 다른 작업에 대해 서로 다른 기준선에 대해 서로 다른 양을 측정하며, 몇몇은 정확도를 전혀 측정하지 않습니다. 이 기사는 2026년 9월에 아홉 개 공급업체의 발표 자료를 읽고 우리가 발견한 내용을 정리하며, 검증 가능한 주장과 검증할 수 없는 주장을 구분하는 여덟 가지 질문을 제시합니다.

우리는 여기에서 이해관계가 있습니다. Minds는 합성 청중을 판매합니다. 따라서 아래의 기준은 우리에게도 동일하게 적용되며, 우리가 가장 나쁜 결과를 보이는 부분은 다른 모든 사람들과 마찬가지로 명확하게 명시됩니다.

## 여덟 가지 질문

발표된 정확도 주장은 다음 질문에 답할 때 검증 가능합니다:

1. **어떤 외부 기준에 대해?** 이름이 붙은 독립적인 데이터 세트 또는 발표된 연구, 내부 샘플이 아닙니다.
2. **어떤 한계에 대해?** 인간은 자신의 답변을 완벽하게 재현하지 않습니다. 그들의 자기 일관성이 현실적인 최대치입니다.
3. **어떤 바닥에 대해?** 모델이 없는 상태에서 동일한 메트릭이 기록하는 점수입니다.
4. **메트릭의 의미는 무엇인가요?** "정확도"는 스스로 정의되지 않습니다.
5. **어떤 기준선과 비교하나요?** 동일한 모델에 대한 단순한 프롬프트가 중요한 비교입니다. 왜냐하면 그것이 무료 대안이기 때문입니다.
6. **누가 검토했나요?** 동료 검토 또는 사전 인쇄물은 수정 요청을 초대합니다.
7. **어디에서 실패하나요?** 발표된 실패 모드가 없는 방법은 충분히 테스트되지 않았습니다.
8. **누구나 검증할 수 있나요?** 방법, 샘플 및 데이터가 검토 가능해야 합니다.

## 이 분야에서 발표하는 내용

공급업체의 공개 페이지와 논문에서 수집한 내용, 2026년 9월.

<table>
<thead>
  <tr>
    <th>
      공급업체
    </th>
    
    <th>
      헤드라인 수치
    </th>
    
    <th>
      측정하는 것
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Simile
    </td>
    
    <td>
      인간 자기 재검증 신뢰도 85%
    </td>
    
    <td>
      출처 개인의 답변 재현, 인간 노이즈 바닥에 대해
    </td>
  </tr>
  
  <tr>
    <td>
      Artificial Societies
    </td>
    
    <td>
      분포 정확도 86%
    </td>
    
    <td>
      명시된 91% 인간 한계에 대한 분포 일치
    </td>
  </tr>
  
  <tr>
    <td>
      Articos
    </td>
    
    <td>
      전문가가 식별한 주제의 86%
    </td>
    
    <td>
      발표된 전문가 보고서에 대한 주제 회수
    </td>
  </tr>
  
  <tr>
    <td>
      Evelance
    </td>
    
    <td>
      주제 중복 89.78%
    </td>
    
    <td>
      주제 일치, 7개의 페르소나 대 23명의 실제 사용자
    </td>
  </tr>
  
  <tr>
    <td>
      Synthetic Users
    </td>
    
    <td>
      85–92% "합성 유기 동등성"
    </td>
    
    <td>
      합성 인터뷰와 실제 인터뷰의 유사성
    </td>
  </tr>
  
  <tr>
    <td>
      Aaru
    </td>
    
    <td>
      중앙 상관관계 0.90
    </td>
    
    <td>
      한 클라이언트 연구에서의 상관관계
    </td>
  </tr>
  
  <tr>
    <td>
      Evidenza
    </td>
    
    <td>
      정확도 88%, 상관관계 0.81
    </td>
    
    <td>
      메트릭이 공개적으로 정의되지 않음
    </td>
  </tr>
  
  <tr>
    <td>
      Fairgen
    </td>
    
    <td>
      98% 정신적 통과율
    </td>
    
    <td>
      내부 품질 기준, 정확도가 아님
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      스피어만 0.85, +4% 스케일 편향
    </td>
    
    <td>
      54개의 광고에 대한 인간 패널과의 순위 상관관계
    </td>
  </tr>
</tbody>
</table>

두 가지 관찰이 뒤따르며, 둘 다 어떤 제품이 더 나은지에 대한 것이 아닙니다.

**가장 높은 숫자는 정확도 수치가 아닙니다.** Fairgen의 98%는 그들의 여섯 차원 품질 기준을 통과한 생성된 프로필의 비율입니다. 이는 출력이 인간 데이터와 일치하는지에 대한 아무런 정보를 제공하지 않으며, Fairgen은 그렇게 주장하지도 않습니다. 이 표를 비율로 정렬하는 사람은 그들이 결코 참여하지 않은 측정에서 첫 번째로 순위를 매기게 됩니다.

**비교 가능한 수치는 두 개뿐입니다.** Simile의 85%와 Artificial Societies의 86%는 모두 인간이 스스로 달성하는 것의 비율로 표현됩니다. 이들은 비교할 수 있습니다. 열의 다른 어떤 것도 서로 비교할 수 없습니다.

## 실패를 발표하는 사람들

여기서 이 분야는 가장 뚜렷하게 구분됩니다.

Fairgen은 그들의 방법이 적합하지 않은 연구를 명시합니다: 브랜드 추적, 세분화, 컨조인트. 그들의 지침은 "현장에 나가기 전에 압력을 테스트하라, 대신에"입니다. Synthetic Users는 합성 응답자가 "보정 없이 개별적으로는 믿을 수 있지만, 집합적으로는 잘못되었다"고 명시합니다. Articos와 Evelance는 모두 그들의 출력이 방향성을 가지며 인간 연구와 함께 있어야 한다고 말합니다.

Aaru, Evidenza 및 Artificial Societies는 우리가 찾을 수 있는 실패 조건을 발표하지 않습니다.

## 우리가 서 있는 위치, 격차 포함

우리의 연구는 네 가지 조건의 제거를 사용하고, 실제 답변을 보류하며, 목표가 열리기 전에 후보 선택을 봉인하고, 결과 옆에 우연의 바닥을 보고합니다. 하나의 GSS 항목 세트에서 모델이 없는 평평한 분포는 이미 83.71%의 점수를 기록합니다; 우리의 92.47%는 남은 거리의 54%를 줄입니다. 바닥은 비율 옆에 있어야 하며, 보통 누락되어 있습니다.

우리는 작동하지 않은 결과를 발표합니다. 등록된 프로필 상승 0.17 포인트는 -1.00에서 +1.31까지의 95% 구간을 가지며, 0을 넘어서고 승진 기준을 충족하지 못했습니다. 블라인드 비교에서 짧은 일상 프롬프트에 대해 우리의 청중은 일반 프롬프트에 대해 30.5%, 인구 통계 프롬프트에 대해 34.0%에 비해 13.8%의 승리를 기록했습니다. 이는 패배이며, 발표되었습니다.

**우리가 갖고 있지 않은 것은 동료 검토입니다.** Simile의 미세 조정 결과는 EMNLP 2025에서 290만 개의 응답이 포함된 공개 데이터 세트와 함께 발표되었습니다. Artificial Societies는 영국 심리학 저널 (British Journal of Psychology)에 그룹 행동 결과를 발표했습니다. 우리는 둘 다 없습니다. 우리의 검증 작업은 우리 사이트에 발표되었으며 외부 검토를 거치지 않았으며, 검토가 이루어질 때까지 독자는 이를 다르게 평가하는 것이 맞습니다.

우리의 SINUS-Institut와의 파트너십은 때때로 검증으로 읽힙니다. 그렇지 않습니다. 그것은 출처입니다: 우리의 페르소나가 기반을 두고 있는 환경 모델은 수십 년간의 그들의 연구에서 나온 것으로, 이는 정확도에 대한 진술이 아니라 입력에 대한 진술입니다. 그들의 관리 이사는 이를 명확하게 설명합니다: Milieu-Minds는 "사회 연구나 우리 연구소의 전문성을 대체하지 않습니다."

## 10분 안에 어떤 공급업체든 검증하는 방법

메트릭의 정의, 샘플 크기, 기준선 및 실패 조건을 요청하십시오. 모델이 없는 상태에서 동일한 측정이 기록하는 점수를 요청하십시오. 공급업체가 이를 제공할 수 없다면, 그 비율은 마케팅일 뿐이며, 누가 발표했든, 얼마나 유리하게 보이든 상관없이 그렇습니다.

그 테스트는 우리에게도 편안하지 않습니다. 그것은 단순히 구매자에게 어떤 정보라도 제공하는 유일한 방법입니다.

## 출처

위의 모든 수치는 각 업체의 공개 자료에서 가져온 것이며, 2026년 9월 22일에 확인했습니다. 주장은 변합니다. 신뢰하기 전에 출처를 확인하십시오. 저희가 잘못 읽었다면 알려주시면 정정하겠습니다.

- [Simile](https://www.simile.com/)
- [Simile, EMNLP 2025 (Kolluri, Wu, Park, Bernstein), SocSci210](https://arxiv.org/abs/2607.26348)
- [Artificial Societies](https://societies.ai/)
- [Artificial Societies, the science behind it](https://societies.io/ai-simulation-research)
- [Articos](https://articos.com/)
- [Evelance](https://evelance.io/)
- [Synthetic Users, science](https://www.syntheticusers.com/science)
- [Aaru](https://www.aaru.com/)
- [Evidenza](https://www.evidenza.ai/)
- [Evidenza, research](https://www.evidenza.ai/research)
- [Fairgen](https://www.fairgen.ai/)
- [Minds validation studies](https://getminds.ai/research)
- [SINUS-Institut and Minds, original release](https://getminds.ai/press/minds-partners-with-sinus)
