---
title: "CES 2024: 다양한 질문 유형에 걸친 설문 적합도"
description: "300명의 매칭된 응답자를 대상으로 27개의 이항형, 순서형, 다중선택형 문항을 평가하여 집계 적합도와 개별 예측을 분리해 분석한 CES 비교 연구입니다."
canonical_url: "https://getminds.ai/research/ko/ces-2024-synthetic-survey-validation"
last_updated: "2026-09-08T04:40:10.745Z"
---

# CES 2024: 다양한 질문 유형에 걸친 설문 적합도

CES 2024 테스트는 프로필 기반 확률 응답을 통해 95.28%의 집계 근사도(aggregate approximation)를 달성했으며, 이는 평균 분포 오차 4.72%p에 해당합니다. 응답 형식 비교 전반에서 확률 도출 방식은 강제 선택형 응답 대비 사전 등록된 부트스트랩 추정치 기준 19.72포인트의 오차 감소 효과를 보였습니다.

본 연구는 설문 검증 근거를 단일 문항 형식을 넘어 확장합니다. 아울러 최종 근사도 점수가 왜 반드시 매칭된 베이스라인과 함께 제시되어야 하는지를 입증합니다.

## 평가 대상 설문 문항

비교 분석에는 300명의 매칭된 CES 응답자와 27개의 홀드아웃(held-out) 문항이 사용되었습니다: 순서형 15개, 이항형 10개, 다중선택형 2개 세트. 이전 응답자 정보가 컨텍스트로 제공되었으며, 평가 대상 응답은 생성 과정에서 철저히 제외되었습니다.

네 가지 조건은 일반 강제 선택, 일반 확률 또는 주변부 확률, 인구통계학적 확률, 풀 프로필 확률이었습니다. 다중선택 문항은 응답자가 둘 이상의 옵션을 선택할 수 있으므로 주변부 확률이 필요합니다. 이는 단일 선택 확률 벡터와 해석 방식이 다릅니다.

## 측정된 분포

<research-figure :labels="["Generic forced choice","Generic probability or marginals","Demographic probability","Full-profile probability"]" figure="ces-2024-synthetic-survey-validation" note="이 연구에서 보고한 결과입니다. 표와 논의에는 연구 범위, 비교 기준 및 불확실성이 포함되어 있습니다." title="문항 평균 절대 오차" unitLabel="퍼센트포인트 · 낮을수록 좋음">



</research-figure>

<table>
<thead>
  <tr>
    <th>
      조건
    </th>
    
    <th align="right">
      문항 평균 절대 오차
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Generic forced choice
    </td>
    
    <td align="right">
      26.927 pp
    </td>
  </tr>
  
  <tr>
    <td>
      Generic probability or marginals
    </td>
    
    <td align="right">
      7.036 pp
    </td>
  </tr>
  
  <tr>
    <td>
      Demographic probability
    </td>
    
    <td align="right">
      4.563 pp
    </td>
  </tr>
  
  <tr>
    <td>
      Full-profile probability
    </td>
    
    <td align="right">
      4.720 pp
    </td>
  </tr>
</tbody>
</table>

근사도는 100에서 평균 절대 퍼센트포인트 오차를 뺀 수치입니다. 따라서 95.28%라는 수치는 이번에 평가된 문항들에 대한 평균 분포 적합도를 나타냅니다. 정확하게 시뮬레이션된 사람의 비율을 의미하는 것이 아닙니다.

사전 등록된 부트스트랩 확률 향상폭은 반올림하여 19.72포인트(원값 19.719포인트)였습니다. 보고된 점 추정 대비치는 19.892포인트였으며, 95% 구간은 16.257에서 23.401이었습니다. 부트스트랩 요약치와 표에 표시된 조건별 평균은 서로 다른 요약 방식과 반올림을 사용하므로, 임의로 상호 대체하여 사용해서는 안 됩니다.

## 더 풍부한 프로필이 개선한 부분과 개선하지 못한 부분

풀 프로필은 일반 확률 프롬프팅보다는 개선을 보였으나, 기본 집계 지표에서 매칭된 인구통계학적 확률 조건을 넘어서지는 못했습니다. 인구통계 대비 프로필 향상폭은 -0.157포인트였으며, 해당 구간은 0을 포함했습니다.

프로필 컨텍스트를 통해 개별 정확도는 개선되었으나, 집계 오차는 인구통계 조건보다 소폭 높았습니다. 따라서 결과는 혼재되어 있습니다. 응답 형식 측면에서는 뚜렷한 발견점이 있었으나, 집계 수준에서는 풀 프로필 조건이 인구통계 조건 대비 확고한 우위를 보이지 못했습니다.

다중선택 문항 세트는 2개만 평가 대상이었습니다. 이는 다양한 질문이 혼합된 설문에서 도출된 근거일 뿐이며, 여러 도메인과 조사 도구 전반에 걸친 다중선택 보정의 보편적 검증을 뜻하지는 않습니다.

## 근거의 적용

분포 추정의 경우, 응답 수집과 집계 방식은 리서치 설계의 명시적인 구성 요소로 다루어져야 합니다. 더 풍부한 오디언스 조건에는 확률 응답을 허용하면서 강제 범주형 베이스라인과 비교한다면 프로필의 고유 가치를 온전히 분리해낼 수 없습니다.

또한 비교 연구는 그 목표가 문항 수준의 모집단 적합도인지, 아니면 개별 예측인지를 명시해야 합니다. 컨텍스트가 풍부해진다고 해서 두 영역 모두에서 자동으로 개선되는 것은 아닙니다. 테스트 대상 표본, 모델 구성, 설문 문항이 해당 주장의 유효 범위를 규정합니다.

이러한 격리된 환경에서의 테스트 결과가 현재 제품의 실제 동작이나 신규 고객 오디언스에 대한 대표성 있는 추정치를 보증하지는 않습니다. 런타임에 타깃을 분리하더라도 공개 소스를 통한 사전학습 노출 가능성은 여전히 존재합니다.

[ANES 종단 연구](/research/anes-2024-synthetic-survey-validation)에서는 동일한 집계 대 개별 예측의 차이를 검토합니다. [PISA 비교](/research/pisa-2022-synthetic-survey-validation)는 5개국 환경을 추가해 다룹니다. [근거 개요](/research/synthetic-audiences-reality-benchmark-2026)에서는 이러한 결과들을 단일 점수로 단순 합산하지 않고 상호 연결하여 제시합니다.

## 참조 데이터

[CES 2024](https://doi.org/10.7910/DVN/X11EP6)
