---
title: "합성 오디언스를 실제 데이터와 대조 검증했습니다"
description: "301개 Mind를 활용한 Z세대 프로덕션 테스트를 포함한 5개 공개 설문 데이터셋을 통해 확인한 합성 오디언스 정확도와 프로필 기반 접지(grounding)의 효과."
canonical_url: "https://getminds.ai/research/ko/synthetic-audiences-reality-benchmark-2026"
last_updated: "2026-09-08T18:33:00.478Z"
---

# 합성 오디언스를 실제 데이터와 대조 검증했습니다

합성 연구(Synthetic research)는 외부 기준점, 즉 실제 사람들의 응답을 필요로 합니다. Minds의 초기 연구 제품군은 합성 응답을 4개의 공개 설문 데이터셋 및 2개의 정성적 벤치마크와 비교했습니다. 이후 진행된 Food and You 프로덕션 테스트는 동일한 질문에 대한 실무적 점검을 더했습니다. 바로 지속형 Mind로 구성된 오디언스가 실제 설문의 응답 분포를 얼마나 근접하게 재현할 수 있는가 하는 점입니다.

결과는 두 가지 뚜렷한 가치 요소를 보여줍니다. 불확실성을 보존하는 것은 설문 분포 추정치의 정확도를 높여 줍니다. 참가자 프로필과 관련 기억은 특정 답변이 개인의 경험, 이유, 가치관에 좌우될 때 추가적인 가치를 제공합니다. 이러한 이점은 수행하는 과업에 따라 달라집니다.

## 엄선된 설문 재현 연구

<research-figure :labels="["GSS 2024","ANES 2024","CES 2024","PISA 2022","Food and You 2, Wave 10"]" figure="synthetic-audiences-reality-benchmark-2026" note="질문지와 코호트가 다르며 PISA는 가중 결과입니다. 오차는 낮을수록 좋습니다. 결과를 하나의 정확도 점수로 합치지 마세요." title="평균 분포 오차" unitLabel="퍼센트포인트 · 낮을수록 좋음">



</research-figure>

<table>
<thead>
  <tr>
    <th>
      재현 연구
    </th>
    
    <th>
      공개 원본 데이터셋
    </th>
    
    <th>
      결과
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <a href="/research/gss-2024-synthetic-survey-validation">
        GSS 2024 설문 재현
      </a>
    </td>
    
    <td>
      <a href="https://gss.norc.org/" rel="nofollow">
        GSS 2024
      </a>
    </td>
    
    <td>
      92.47% 근사율 · 평균 오차 7.53 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/anes-2024-synthetic-survey-validation">
        ANES 2024 종단 재현
      </a>
    </td>
    
    <td>
      <a href="https://electionstudies.org/data-center/2024-time-series-study/" rel="nofollow">
        ANES 2024 Time Series Study
      </a>
    </td>
    
    <td>
      91.67% 근사율 · 평균 오차 8.33 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/ces-2024-synthetic-survey-validation">
        CES 2024 사전/사후 재현
      </a>
    </td>
    
    <td>
      <a href="https://doi.org/10.7910/DVN/X11EP6" rel="nofollow">
        2024 Canadian Election Study
      </a>
    </td>
    
    <td>
      95.28% 근사율 · 평균 오차 4.72 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/pisa-2022-synthetic-survey-validation">
        PISA 2022 국제 재현
      </a>
    </td>
    
    <td>
      <a href="https://www.oecd.org/en/data/datasets/pisa-2022-database.html" rel="nofollow">
        PISA 2022 Database
      </a>
    </td>
    
    <td>
      93.80% 근사율 · 가중 평균 오차 6.20 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/synthetic-gen-z-food-survey-validation-2026">
        Food and You 2 프로덕션 재현
      </a>
    </td>
    
    <td>
      <a href="https://data.food.gov.uk/catalog/datasets/e5ac7f57-61d4-4e34-8d74-fe198ab5d858" rel="nofollow">
        Food and You 2, Wave 10
      </a>
    </td>
    
    <td>
      93.99% 근사율 · 평균 오차 6.01 pp · Pearson 0.804 · Spearman 0.834
    </td>
  </tr>
</tbody>
</table>

집계 근사율(Aggregate approximation)은 100에서 평균 절대 백분율 포인트 오차를 뺀 값을 의미합니다. 이는 응답 분포 간의 격차를 측정하는 수치입니다. 특정 개별 응답자의 동일한 비율이 정확하게 예측되었다는 뜻은 아닙니다. 각 연구는 가중치가 적용된 PISA 결과를 포함해 서로 다른 조사 도구와 집계 세부 기준을 사용하므로, 각 행의 수치를 하나의 단일 정확도 점수로 단순 평균해서는 안 됩니다.

처음 4개 행은 독립된 초기 설문 실험에 해당합니다. 5번째 행은 기존의 고정 코호트를 대상으로 실행한 후속 프로덕션 결과입니다. 이 결과를 포함함으로써 해당 코호트에 대한 반복 테스트를 새로운 독립 모집단 연구로 둔갑시키지 않으면서도 전체적인 실증 데이터의 범위를 확장할 수 있습니다.

## Z세대: 프로덕션을 통해 실행한 실제 설문지

영국 식품기준청(Food Standards Agency)의 Food and You 2 설문조사는 청년층이 아침, 점심, 저녁 식사로 외식을 하거나 포장 음식을 얼마나 자주 사 먹는지를 조사했습니다. 프로덕션 비교 테스트에서는 16세에서 24세 사이의 지속형 Mind 301개에 동일한 3가지 질문을 제시하고, 그에 따른 분포를 발표된 실제 청년층 조사 결과와 비교했습니다. 평가된 각 문항의 실제 응답자 모수는 257명이었습니다.

계획된 903건의 응답이 모두 완료되었습니다. 21개 응답 보기 셀 전체에서 평균 절대 오차는 6.01 percentage points였으며, 평균 분포 중첩도(distribution overlap)는 78.98%였습니다. 이 두 지표는 서로 다른 특성을 나타냅니다. 근사율 변환 수치가 셀의 평균 오차를 요약하는 반면, 중첩도는 두 분포가 확률 질량을 얼마나 공유하는지를 보여줍니다.

8월 18일 실행 결과는 동일한 코호트 및 조사 도구를 사용했던 8월 9일 결과보다 개선되었습니다. 오차는 7.33 포인트에서 6.01 포인트로 감소하여 18.0%의 상대적 개선율을 보였습니다. 모든 문항에서 오차가 줄었습니다. 다만 이 비교는 동시 무작위 대조군 비교가 아니라, 과거 데이터를 대조군으로 삼은 프로덕션 회귀 테스트였습니다.

기준선(베이스라인)에 대한 맥락도 중요합니다. 동일한 셀을 기준으로 고정된 일반 확률 프롬프트는 6.68 포인트 오차를, 동일 확률 귀무 모델(null model)은 7.00 포인트 오차를 기록했습니다. 프로덕션 결과가 기술적으로 더 우수하긴 했으나, 해당 베이스라인들이 동일 시점에 동시에 재실행된 것은 아니었습니다. 따라서 근사율 척도에서 90점대 점수를 얻었다는 사실 자체만으로 압도적인 우위가 있다고 해석해서는 안 됩니다.

[Z세대 식품 설문조사 전체 기사](/research/synthetic-gen-z-food-survey-validation-2026)에서 오디언스, 설문 문항, 데이터 출처 및 문항별 결과를 자세히 확인할 수 있습니다. 영국 식품기준청(Food Standards Agency)은 공개 참조 데이터셋을 제공했을 뿐이며, Minds의 본 연구를 후원, 지지 또는 검토하지 않았습니다.

## 불확실성 보존이 설문 추정치를 개선한 이유

초기 4개 설문 실험에서 확률 기반 응답은 단일 선택을 강제한 경우에 비해 분포 오차를 12.47에서 19.72 percentage points 줄였습니다. 이러한 개선 효과는 4개 데이터셋 전체에서 일관되게 나타났습니다.

확률 응답은 범주형 선택에서 버려지는 불확실성을 그대로 유지합니다. 전체 오디언스에 걸쳐 집계될 때, 이러한 확률값은 각 합성 응답자에게 강제된 단일 선택보다 모집단 분포를 훨씬 더 정확하게 복원해 낼 수 있습니다.

이 결과는 응답 수집과 집계 방식에 관한 것입니다. 동일한 실험에서 상세한 프로필이 인구통계 기반 확률 프롬프트를 일관되게 능가한다는 증거는 발견되지 않았습니다. 최종 점수만큼이나 비교 기준선과 응답 포맷이 중요합니다.

## 기타 엄선된 검증

이 연구들은 서로 다른 결과 변수를 사용하므로, 근사율 백분율을 적용하면 왜곡이 발생할 수 있습니다. 따라서 이 데이터는 설문 정확도 범위를 확장하기보다는 설문 실증 결과를 보완하는 역할을 합니다.

<table>
<thead>
  <tr>
    <th>
      연구 및 세부 결과
    </th>
    
    <th>
      평가 대상 표본
    </th>
    
    <th>
      보고된 결과
    </th>
    
    <th>
      근사율
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <a href="/research/prism-alignment-participant-fit-validation">
        PRISM Alignment
      </a>
    </td>
    
    <td>
      참가자 299명, 869개 문항
    </td>
    
    <td>
      참가자 적합도 승률 32.6%, 인구통계 프롬프트 25.7%, 일반 프롬프트 20.5%
    </td>
    
    <td>
      해당 없음
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/held-out-interview-response-validation">
        Held-out interviews
      </a>
    </td>
    
    <td>
      22명, 66개 응답, 2개 말뭉치
    </td>
    
    <td>
      일반 프롬프트 대비 참가자 군집 추정치 기준 +24.37 종합 점수
    </td>
    
    <td>
      해당 없음
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/synthetic-audiences-vs-foundation-models">
        Named foundation models
      </a>
    </td>
    
    <td>
      동일 22명 및 66개 응답 (신규 코호트 아님)
    </td>
    
    <td>
      GPT-5.4 대비 +25.49 포인트, Claude Sonnet 5 대비 +30.05 포인트
    </td>
    
    <td>
      해당 없음
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/spark-effect-creative-diversity-multi-agent-ai">
        Spark creative diversity
      </a>
    </td>
    
    <td>
      7개 크리에이티브 과업
    </td>
    
    <td>
      평균 다양성 7.90/10 (균일 베이스라인 3.14/10 대비)
    </td>
    
    <td>
      해당 없음
    </td>
  </tr>
</tbody>
</table>

Spark는 아이디어의 다양성을 평가하며, 대표성 있는 설문과의 일치도나 실제 광고 성과의 예측 여부를 평가하지는 않습니다. 인터뷰 비교 연구는 시뮬레이션이 성공한 사람의 비율이 아닌 자동화된 판정 모델(automated judges)을 사용했습니다.

## 참가자 맥락이 기여한 부분

초기 정성 평가에서는 생성 시점에 제외(withheld)되었던 실제 인간의 후속 응답을 평가했습니다. PRISM Alignment 비교에서 전체 프로필이 적용된 Minds는 32.6%의 블라인드 승률(winner rate)을 기록하여, 인구통계 프롬프트(25.7%) 및 일반 프롬프트(20.5%)를 앞섰습니다. 여기서 사용된 PRISM 데이터셋은 외부 벤치마크이며 Minds의 자체 PRISM 접근 방식과는 구별됩니다.

독립된 인터뷰 검증 연구에서는 2개의 공개 말뭉치, 22명의 참가자, 66개의 후속 응답을 사용했습니다. 해당 보고서에서는 2개 말뭉치 모두에서, 그리고 두 번째 버전의 판정 모델에서도 프로필 및 검색(retrieval) 결합 방식이 일반 프롬프트 대비 긍정적인 우위를 보였습니다. [주요 파운데이션 모델 비교](/research/synthetic-audiences-vs-foundation-models) 연구에서는 일반 GPT 및 Claude 응답을 대조군으로 삼아 이러한 우위를 심층 분석합니다. 해당 베이스라인들에는 참가자의 과거 이력이 제공되지 않았습니다.

이 실험들은 참가자 적합성, 이유, 구체성 및 어조(voice)를 다룹니다. 판정 모델 점수를 설문 분포 백분율과 결합해서는 안 됩니다. 두 지표 모두 합성 응답자에게 어떤 근거 자료가 제공되는지에 따라 달라지며, 정성적 평가는 여전히 독립적인 인간 평가자의 추가 검증을 필요로 합니다.

## 실증 근거의 적용 범위와 한계

초기 연구 제품군은 설문 및 정성적 벤치마크 전반에 걸쳐 총 1,881명의 참가자를 대상으로 했습니다. 추가된 301개 Mind 식품 테스트는 고유한 코호트와 실제 인간 대조 분모를 가지고 있으므로 서로 분리해서 취급해야 합니다.

보고된 테스트에서 정답 데이터(target)는 런타임 입력에서 제외되었습니다. 그러나 공개 출처 데이터가 모델 사전 훈련에 포함되었을 가능성이 있으므로, 런타임 분리만으로 모든 사전 노출이 완전히 없었다고 단정할 수는 없습니다. 또한 초기 설문 결과는 격리된 테스트 환경(harness)에서 도출되었으므로, 모든 제품 버전에서 완전히 동일하게 동작한다는 것을 보증하지는 않습니다. PISA 연구는 5개국 전체에서 영문 마스터 설문 문항을 사용했습니다.

이 개요는 Minds가 수행한 모든 실험에 대한 전수 조사가 아니라, 검증 승인된 주요 실증 근거만을 제시합니다. 다른 탐색적 테스트 및 실패한 테스트에는 그에 맞는 고유한 맥락이 필요합니다. 이러한 연구 결과의 실무적 효용은 특정 질문에 적합한 오디언스, 응답 포맷, 검증 방식을 올바르게 선택하는 데 있습니다.

패널 구축 워크플로는 [Minds 리서치 패널 구축 방식](/research/methodology)에서 확인하시고, 합성 데이터 결과가 뒷받침할 수 있는 범위를 판단할 때는 [검증 체크리스트](/research/synthetic-audiences-validation-checklist)를 활용하시기 바랍니다.
