·Validation·Minds Team

ANES 2024: 합성 응답과 후속 인간 응답 비교

300명의 매칭된 패널과 28개 후속 문항을 바탕으로 진행된 ANES 선거 전후 비교 연구로, 응답 형식과 참가자 프로필 접지(grounding)에 따른 결과를 각각 분석합니다.

ANES 2024 비교 연구에서는 검색된 프로필 기반의 확률형 응답을 통해 91.67%의 종합 근사치(집계 분포 평균 오차 8.33%p)를 기록했습니다. 가장 뚜렷하게 측정된 개선은 확률 추정(probability elicitation)에서 나타났습니다. 일반 확률형 응답은 일반 강제 선택형(forced choice) 대비 오차를 12.47%p 줄였습니다.

모델에 이미 제공된 응답을 사후 재구성하는 비교와 달리, 본 설계는 선거 전 수집된 응답자 데이터를 활용해 모델에 공개되지 않은 선거 후 응답을 평가했습니다.

종단적 검증

표본은 300명의 매칭된 응답자와 28개의 후속 문항으로 구성되었습니다. 런타임 생성 과정에서는 인간 응답자 정답을 제외했으며, 평가 전 후보 데이터는 봉인되었습니다. 실험 조건은 일반 강제 선택, 일반 확률, 인구통계 기반 확률, 검색된 프로필 데이터 기반 확률의 네 가지로 구분했습니다.

이전 시점의 데이터는 응답자에 관한 맥락을 제공할 수 있지만, 이는 후속 응답을 사전에 아는 것과는 전혀 다릅니다. 이 같은 시차 분리는 사전 정보가 다음 설문으로 얼마나 일관되게 이어지는지 검증하는 유용한 시험대가 됩니다.

분포 결과

문항별 평균 절대 오차

이 연구에서 보고한 결과입니다. 표와 논의에는 연구 범위, 비교 기준 및 불확실성이 포함되어 있습니다.

  • 일반 강제 선택22.782
  • 일반 확률10.312
  • 인구통계 기반 확률8.263
  • 검색 프로필 기반 확률8.330
0퍼센트포인트 · 낮을수록 좋음30
조건문항별 평균 절대 오차
일반 강제 선택22.782 pp
일반 확률10.312 pp
인구통계 기반 확률8.263 pp
검색 프로필 기반 확률8.330 pp

최종 근사치 변환값은 100에서 8.33을 뺀 91.67%입니다. 이는 개별 응답 예측 정확도나 선거 결과 예측치가 아니라, 응답 범주별 평균 분포 오차를 나타냅니다.

일반 확률과 일반 강제 선택을 비교했을 때 기록된 개선 폭은 12.47%p였습니다. 해당 비교에서 평가된 문항 중 2%p 이상 오차가 악화된 문항은 없었습니다. 따라서 응답 형식에 따른 개선 효과는 특정 문항에 국한되지 않고 전반적으로 나타났습니다.

접지와 집계는 서로 다른 문제입니다

검색된 프로필은 인구통계 기반 확률 프롬프트 대비 집계 평균 절대 오차를 개선하지 못했습니다. 기록된 오차 차이는 +0.046%p였으며, 신뢰구간은 0을 포함했습니다. 기술 통계 표에서도 인구통계 기반 확률이 근소하게 앞서는 것으로 나타납니다.

프로필 활용은 개별 브라이어 점수(Brier score)와 정확도를 소폭 개선한 반면, 모집단 보정(population calibration)은 약간 저하시켰습니다. 이러한 결과는 공존할 수 있습니다. 개인의 응답을 예측하는 것과 오디언스의 분포를 재구성하는 것은 서로 다른 목표이기 때문입니다. 유리한 지표만 취사선택하는 것은 연구 결과를 왜곡하는 일입니다.

이 실험의 전반적인 결과는 복합적입니다. 확률 추정 방식의 유효성은 입증되었으나, 프로필 추가가 가져오는 집계 차원의 점진적 이점은 명확히 확인되지 않았습니다.

시사점 및 한계

합성 오디언스를 비교하기 전에 평가 목표부터 명확히 설정해야 합니다. 개별 응답 과제에는 개별 지표가 필요하고, 오디언스 분포 과제에는 집계 보정이 필요합니다. 한쪽에서 좋은 점수를 얻었다고 해서 다른 쪽을 대체할 수는 없습니다.

본 평가는 구조화된 선거 전 데이터를 활용한 격리된 테스트 환경에서 진행되었으며, 실제 상용화된 완성형 Mind 파이프라인 전체를 반영한 것은 아닙니다. 평가된 표본과 후속 문항들이 모든 정치적 오디언스나 설문 도구에 대한 일반적 타당성을 보장하지는 않습니다. 또한 런타임 데이터 제외가 모델 학습 과정에서의 공개 데이터 사전 노출 가능성까지 완전히 배제하지는 못합니다.

GSS 파일럿 연구에서는 또 다른 응답 형식 비교를 확인할 수 있습니다. CES 연구에서는 검증 도구를 여러 문항 형식으로 확장했습니다. 증거 개요에서는 각 연구의 점수와 범위를 명확히 구분하여 다룹니다.

참조 데이터

ANES 2024