합성 청중 정확도 주장 읽는 법
아홉 개의 합성 청중 공급업체가 정확도 수치를 발표합니다. 그들은 서로 다른 메트릭, 서로 다른 기준선 및 서로 다른 샘플을 사용하므로 숫자를 서로 비교할 수 없습니다. 여덟 가지 질문이 검증 가능한 주장과 검증할 수 없는 주장을 구분합니다.
합성 연구 공급업체는 85%에서 98% 사이의 정확도 수치를 발표합니다. 빠르게 읽으면, 이 분야는 정착된 것처럼 보이고 차이는 작아 보입니다.
그러나 이들은 비교할 수 없습니다. 비율은 서로 다른 작업에 대해 서로 다른 기준선에 대해 서로 다른 양을 측정하며, 몇몇은 정확도를 전혀 측정하지 않습니다. 이 기사는 2026년 9월에 아홉 개 공급업체의 발표 자료를 읽고 우리가 발견한 내용을 정리하며, 검증 가능한 주장과 검증할 수 없는 주장을 구분하는 여덟 가지 질문을 제시합니다.
우리는 여기에서 이해관계가 있습니다. Minds는 합성 청중을 판매합니다. 따라서 아래의 기준은 우리에게도 동일하게 적용되며, 우리가 가장 나쁜 결과를 보이는 부분은 다른 모든 사람들과 마찬가지로 명확하게 명시됩니다.
여덟 가지 질문
발표된 정확도 주장은 다음 질문에 답할 때 검증 가능합니다:
- 어떤 외부 기준에 대해? 이름이 붙은 독립적인 데이터 세트 또는 발표된 연구, 내부 샘플이 아닙니다.
- 어떤 한계에 대해? 인간은 자신의 답변을 완벽하게 재현하지 않습니다. 그들의 자기 일관성이 현실적인 최대치입니다.
- 어떤 바닥에 대해? 모델이 없는 상태에서 동일한 메트릭이 기록하는 점수입니다.
- 메트릭의 의미는 무엇인가요? "정확도"는 스스로 정의되지 않습니다.
- 어떤 기준선과 비교하나요? 동일한 모델에 대한 단순한 프롬프트가 중요한 비교입니다. 왜냐하면 그것이 무료 대안이기 때문입니다.
- 누가 검토했나요? 동료 검토 또는 사전 인쇄물은 수정 요청을 초대합니다.
- 어디에서 실패하나요? 발표된 실패 모드가 없는 방법은 충분히 테스트되지 않았습니다.
- 누구나 검증할 수 있나요? 방법, 샘플 및 데이터가 검토 가능해야 합니다.
이 분야에서 발표하는 내용
공급업체의 공개 페이지와 논문에서 수집한 내용, 2026년 9월.
| 공급업체 | 헤드라인 수치 | 측정하는 것 |
|---|---|---|
| Simile | 인간 자기 재검증 신뢰도 85% | 출처 개인의 답변 재현, 인간 노이즈 바닥에 대해 |
| Artificial Societies | 분포 정확도 86% | 명시된 91% 인간 한계에 대한 분포 일치 |
| Articos | 전문가가 식별한 주제의 86% | 발표된 전문가 보고서에 대한 주제 회수 |
| Evelance | 주제 중복 89.78% | 주제 일치, 7개의 페르소나 대 23명의 실제 사용자 |
| Synthetic Users | 85–92% "합성 유기 동등성" | 합성 인터뷰와 실제 인터뷰의 유사성 |
| Aaru | 중앙 상관관계 0.90 | 한 클라이언트 연구에서의 상관관계 |
| Evidenza | 정확도 88%, 상관관계 0.81 | 메트릭이 공개적으로 정의되지 않음 |
| Fairgen | 98% 정신적 통과율 | 내부 품질 기준, 정확도가 아님 |
| Minds | 스피어만 0.85, +4% 스케일 편향 | 54개의 광고에 대한 인간 패널과의 순위 상관관계 |
두 가지 관찰이 뒤따르며, 둘 다 어떤 제품이 더 나은지에 대한 것이 아닙니다.
가장 높은 숫자는 정확도 수치가 아닙니다. Fairgen의 98%는 그들의 여섯 차원 품질 기준을 통과한 생성된 프로필의 비율입니다. 이는 출력이 인간 데이터와 일치하는지에 대한 아무런 정보를 제공하지 않으며, Fairgen은 그렇게 주장하지도 않습니다. 이 표를 비율로 정렬하는 사람은 그들이 결코 참여하지 않은 측정에서 첫 번째로 순위를 매기게 됩니다.
비교 가능한 수치는 두 개뿐입니다. Simile의 85%와 Artificial Societies의 86%는 모두 인간이 스스로 달성하는 것의 비율로 표현됩니다. 이들은 비교할 수 있습니다. 열의 다른 어떤 것도 서로 비교할 수 없습니다.
실패를 발표하는 사람들
여기서 이 분야는 가장 뚜렷하게 구분됩니다.
Fairgen은 그들의 방법이 적합하지 않은 연구를 명시합니다: 브랜드 추적, 세분화, 컨조인트. 그들의 지침은 "현장에 나가기 전에 압력을 테스트하라, 대신에"입니다. Synthetic Users는 합성 응답자가 "보정 없이 개별적으로는 믿을 수 있지만, 집합적으로는 잘못되었다"고 명시합니다. Articos와 Evelance는 모두 그들의 출력이 방향성을 가지며 인간 연구와 함께 있어야 한다고 말합니다.
Aaru, Evidenza 및 Artificial Societies는 우리가 찾을 수 있는 실패 조건을 발표하지 않습니다.
우리가 서 있는 위치, 격차 포함
우리의 연구는 네 가지 조건의 제거를 사용하고, 실제 답변을 보류하며, 목표가 열리기 전에 후보 선택을 봉인하고, 결과 옆에 우연의 바닥을 보고합니다. 하나의 GSS 항목 세트에서 모델이 없는 평평한 분포는 이미 83.71%의 점수를 기록합니다; 우리의 92.47%는 남은 거리의 54%를 줄입니다. 바닥은 비율 옆에 있어야 하며, 보통 누락되어 있습니다.
우리는 작동하지 않은 결과를 발표합니다. 등록된 프로필 상승 0.17 포인트는 -1.00에서 +1.31까지의 95% 구간을 가지며, 0을 넘어서고 승진 기준을 충족하지 못했습니다. 블라인드 비교에서 짧은 일상 프롬프트에 대해 우리의 청중은 일반 프롬프트에 대해 30.5%, 인구 통계 프롬프트에 대해 34.0%에 비해 13.8%의 승리를 기록했습니다. 이는 패배이며, 발표되었습니다.
우리가 갖고 있지 않은 것은 동료 검토입니다. Simile의 미세 조정 결과는 EMNLP 2025에서 290만 개의 응답이 포함된 공개 데이터 세트와 함께 발표되었습니다. Artificial Societies는 영국 심리학 저널 (British Journal of Psychology)에 그룹 행동 결과를 발표했습니다. 우리는 둘 다 없습니다. 우리의 검증 작업은 우리 사이트에 발표되었으며 외부 검토를 거치지 않았으며, 검토가 이루어질 때까지 독자는 이를 다르게 평가하는 것이 맞습니다.
우리의 SINUS-Institut와의 파트너십은 때때로 검증으로 읽힙니다. 그렇지 않습니다. 그것은 출처입니다: 우리의 페르소나가 기반을 두고 있는 환경 모델은 수십 년간의 그들의 연구에서 나온 것으로, 이는 정확도에 대한 진술이 아니라 입력에 대한 진술입니다. 그들의 관리 이사는 이를 명확하게 설명합니다: Milieu-Minds는 "사회 연구나 우리 연구소의 전문성을 대체하지 않습니다."
10분 안에 어떤 공급업체든 검증하는 방법
메트릭의 정의, 샘플 크기, 기준선 및 실패 조건을 요청하십시오. 모델이 없는 상태에서 동일한 측정이 기록하는 점수를 요청하십시오. 공급업체가 이를 제공할 수 없다면, 그 비율은 마케팅일 뿐이며, 누가 발표했든, 얼마나 유리하게 보이든 상관없이 그렇습니다.
그 테스트는 우리에게도 편안하지 않습니다. 그것은 단순히 구매자에게 어떤 정보라도 제공하는 유일한 방법입니다.
출처
위의 모든 수치는 각 업체의 공개 자료에서 가져온 것이며, 2026년 9월 22일에 확인했습니다. 주장은 변합니다. 신뢰하기 전에 출처를 확인하십시오. 저희가 잘못 읽었다면 알려주시면 정정하겠습니다.
자주 묻는 질문
합성 청중의 정확도는 얼마나 됩니까?
단일 숫자는 없습니다. 발표된 수치는 85%에서 98%까지 다양하지만, 서로 다른 것을 측정합니다: 주제 중복, 분포 일치, 응답 일관성, 품질 기준 통과율 및 순위 상관관계는 서로 교환할 수 없습니다. 정확도 수치는 해당 메트릭, 기준선 및 측정된 작업과 함께 있을 때만 의미가 있습니다.
왜 두 공급업체의 정확도 비율을 비교할 수 없습니까?
분모가 다르기 때문입니다. 한 공급업체는 전문가 보고서에서 회수한 주제의 비율을 보고할 수 있고, 다른 공급업체는 일치하는 응답 분포의 비율을 보고할 수 있으며, 또 다른 공급업체는 내부 품질 기준을 통과한 생성된 프로필의 비율을 보고할 수 있습니다. 이러한 숫자를 서로 비교하면 의미 없는 순서가 나옵니다.
인간의 한계란 무엇이며, 왜 중요한가요?
인간은 자신의 설문 응답을 완벽하게 재현하지 않습니다. 2주 후 다시 질문하면, 그들은 자신과 다릅니다. 그 자기 일관성 비율은 어떤 시뮬레이션의 현실적인 한계이므로, 결과를 그 비율의 일부로 보고하는 것이 원시 비율을 보고하는 것보다 더 유익합니다.
우연의 바닥이란 무엇인가요?
모델과 데이터가 전혀 없는 상태에서 접근 방식이 달성하는 점수입니다. 우리의 GSS 항목 세트 중 하나에서, 평평한 분포는 이미 83.71%의 점수를 기록합니다. 따라서 보고된 92.47%는 그 바닥과 완벽한 점수 사이의 54%의 거리를 줄이는 것이며, 이는 '92% 정확하다'는 주장과는 매우 다른 주장입니다.


