·Research·Minds Team

합성 오디언스가 범용 파운데이션 모델보다 뛰어난 성과를 내는 경우

참여자 프로필과 메모리가 범용 GPT, Claude, Gemini 프롬프트 대비 합성 응답의 품질을 언제 향상시키는지 홀드아웃 인터뷰 비교 테스트로 검증합니다.

파운데이션 모델은 인터뷰 질문에 대해 그럴듯한 답변을 생성할 수 있습니다. 하지만 특정 개인이 실제로 할 법한 말을 재현하는 것은 훨씬 더 구체적인 과제입니다. 모델이 유창한 범용 응답을 생성하는 능력보다, 해당 인물의 과거 경험, 가치관, 판단 이유가 훨씬 더 중요하게 작용할 수 있기 때문입니다.

본 연구에서는 22명으로부터 수집한 66개의 홀드아웃 인터뷰 답변을 통해 이 차이를 테스트했습니다. 간결한 참여자 프로필과 검색된 이전 증거를 갖춘 합성 응답자는 블라인드 참여자 적합도 종합 평가에서 범용 GPT-5.4 및 Claude Sonnet 5 응답보다 우수한 성과를 보였습니다. 주요 이점으로는 GPT 대비 25.49포인트, Claude 대비 30.05포인트 높은 점수를 기록했습니다. 두 번째 평가자 버전에서도 이러한 긍정적인 비교 결과가 재현되었습니다.

이러한 비교는 합성 오디언스의 구체적인 활용 방안을 뒷받침합니다. 바로 특정 증거에 의존하는 질문에 관련 참여자 증거를 반영하는 것입니다. 범용 모델에는 참여자의 이전 이력이 전혀 제공되지 않았습니다. 따라서 이 결과는 동일한 컨텍스트 조건에서의 모델 역량 순위라기보다는, 그라운딩된 워크플로와 범용 프롬프트 방식의 비교로 보아야 합니다.

테스트: 이전 증거와 이후 답변

이 벤치마크는 레이저 치과 개원의 및 난민 식량 불안 문제를 다룬 두 개의 공개 인터뷰 코퍼스를 활용했습니다. 이전 인터뷰 증거는 간결한 프로필과 검색 가능한 메모리로 변환되었습니다. 평가를 위해 개인당 이후 답변 3개를 홀드아웃하여 보관했으며, 이를 통해 22명으로부터 총 66개의 목표 답변을 확보했습니다.

각 목표 질문에 대해 네 가지 익명 후보 응답이 주어졌습니다: 프로필 및 검색 적용 조건, 동일한 기반 Gemini 계열 모델의 범용 응답, 범용 GPT-5.4, 범용 Claude Sonnet 5. 후보 답변은 채점 전에 블라인드 처리되었으며, 평가자는 조건 라벨 없이 이를 평가했습니다.

평가 루브릭은 실제 답변과의 일치도, 관점 및 가치관, 판단 이유, 구체성, 어조 및 분량 적합성을 평가했으며, 이와 함께 범용성과 근거 없는 개인적 사실 생성 여부도 검토했습니다. 이는 참여자 적합도의 차원입니다. 광고 전환율, 일반 지능, 또는 정확히 시뮬레이션된 인간의 비율을 측정한 수치가 아닙니다.

측정된 성과 우위

참여자 적합도 종합 점수

22명, 평가용으로 분리한 답변 66개. 기본 자동 평가자의 점수입니다. 일반 모델에는 참여자 이력이 제공되지 않았으므로 동일 맥락의 모델 순위가 아닙니다.

  • 프로필 + 검색67.66
  • 일반 GPT-5.442.17
  • 일반 Claude Sonnet 537.61
  • 일반 Gemini35.24
0점수 / 100100
프로필 및 검색 적용 조건과의 비교기본 종합 리프트참여자 클러스터 95% 부트스트랩 구간보조 평가자 리프트
동일 모델 범용 Gemini 응답+32.42 points+23.93 to +40.52+32.83 points
범용 GPT-5.4+25.49 points+15.99 to +34.56+26.13 points
범용 Claude Sonnet 5+30.05 points+21.86 to +38.12+30.68 points

기본 평가자 기준에서, 그라운딩된 조건은 종합 점수 67.66점을 기록한 반면, 범용 GPT는 42.17점, 범용 Claude는 37.61점, 동일 모델 범용 응답은 35.24점을 기록했습니다. 두 코퍼스 모두 두 평가자 버전 전반에서 언급된 GPT 및 Claude 조건 대비 평균적으로 긍정적인 우위를 보였습니다.

두 평가자 버전은 전체 항목의 81.8%에서 승자에 대해 일치된 판단을 내렸습니다. 두 평가자 모두 Gemini 계열 모델이었으므로, 이는 독립적인 인간 평가자 간 또는 서로 무관한 평가자 계열 간의 일치도가 아니라, 동일 계열 내에서의 버전 민감도를 확인한 결과입니다.

그라운딩이 효과적인 이유

가장 직접적인 해석은 관련 증거에 대한 접근성입니다. 범용 모델은 누락된 개인적 맥락을 일반적인 패턴을 사용해 채워 넣어야 합니다. 반면 그라운딩된 응답자는 기록된 경험과 선호도를 바탕으로 답변을 구성할 수 있습니다.

직업적 의사결정에 관한 질문의 경우, 이전 증거를 통해 해당 인물의 제약 사항, 사전 경험, 특정 옵션을 선택한 이유를 파악할 수 있습니다. 따라서 응답은 두루뭉술하게 타당한 조언을 늘어놓는 대신 이러한 구체적인 맥락을 반영하게 됩니다. 벤치마크에서도 그라운딩된 조건은 구체성과 판단 이유 항목에서 더 높은 점수를 받았으며, 범용성이 덜하다는 평가를 받았습니다.

이 지점에서 동일 모델의 범용 응답과의 비교가 유용합니다. 기반 모델 계열을 고정한 채 프로필 및 검색 조건만 변경한 결과는, 이번 과제에서 추가된 그라운딩 워크플로의 명확한 우위를 보여줍니다. 다만 이 워크플로의 어느 부분이 성과 향상에 얼마나 기여했는지는 개별적으로 분리해 설명하지 못합니다. 프로필, 검색, 추가 컨텍스트 및 관련 프롬프트가 함께 변경되었기 때문입니다.

이 결과는 관련 메모리가 지닌 가치와 일치합니다. 그렇다고 해서 컨텍스트를 더 많이 추가하는 것이 항상 도움이 된다거나, 저장된 모든 사실이 모든 답변에 반드시 등장해야 한다는 점을 입증하는 것은 아닙니다.

이러한 우위가 가장 타당하게 발휘되는 시점

이러한 증거는 연구 질문이 개인의 이력, 과거에 표현된 선호, 구체적 경험 또는 결정 이면의 이유에 의존할 때 가장 직접적인 관련성을 갖습니다. 후속 인터뷰나 동일한 제안을 오디언스마다 왜 다르게 해석하는지 탐색하는 작업이 이러한 패턴에 부합합니다.

실무적인 유용한 판단 기준은, 이 특정 개인의 이전 답변을 아는 것이 응답을 실질적으로 바꿀 수 있는가 하는 점입니다. 그렇다면 그라운딩된 증거가 가치를 발휘할 수 있습니다. 만약 질문이 일반적인 사실적 지식만을 요구한다면, 본 실험은 역량 있는 범용 모델 대비 합성 오디언스의 우위를 입증하지 않습니다.

인터뷰 벤치마크 내에서도 이러한 우위가 보편적이지는 않았습니다. 탐색적 성찰 질문 슬라이스에서는 GPT가 그라운딩된 조건보다 10.75포인트 더 높은 점수를 기록했습니다. 해당 슬라이스는 3명으로부터 추출한 5개 항목에 불과해 신뢰할 수 있는 과제 순위를 확립하기에는 표본이 너무 작습니다. 그럼에도 불구하고 평균적인 우위를 모든 종류의 질문에서 거둔 승리로 해석해서는 안 된다는 점을 분명히 보여줍니다.

설문조사에는 별도의 설명이 필요합니다

Against Reality 설문조사 개요에 따르면, 확률 기반 응답 수집 방식은 강제 선택형 답변 대비 집계 분포를 일관되게 개선하는 것으로 나타났습니다. 반면 상세한 프로필은 일치된 인구통계학적 확률 프롬프트 수준을 넘어 해당 분포를 일관되게 개선하지는 못했습니다.

이는 공정한 파운데이션 모델 비교를 위해 매우 중요합니다. 확률 기반 오디언스와 강제 선택형 범용 모델을 비교하면 그라운딩의 효과와 응답 형식의 효과가 뒤섞이게 됩니다. 추가적인 그라운딩 가치를 측정하는 것이 목적이라면 두 모델 모두 동일한 응답 계약을 적용받아야 합니다.

Z세대 식품 설문조사 테스트는 보다 제한적인 정량적 사례를 제시합니다. 이후 진행된 프로덕션 런의 오차는 6.01포인트였으며, 동결된 범용 확률 기준선의 오차는 6.68포인트였습니다. 0.67포인트 차이는 범용 기준선이 과거 데이터였기 때문에 서술적 참고치에 불과합니다. 따라서 이를 근거로 합성 오디언스가 설문조사에서 파운데이션 모델을 능가한다는 식의 광범위한 주장을 펼칠 수는 없습니다.

이번 비교가 열어둔 한계점과 과제

본 연구는 코퍼스 2개, 참여자 22명, 답변 66개로 규모가 작습니다. 일부 인터뷰는 영어로 번역되어 어조와 스타일의 의미에 영향을 미쳤을 수 있습니다. 모델 버전과 샘플링 제어가 달랐으며, 비교 대상인 범용 모델에는 참여자 증거가 제공되지 않았습니다. 동일한 컨텍스트 조건에서 비교하려면 각 모델에 동일하게 허용된 소스 자료를 제공하고, 응답 계약을 고정한 뒤 품질뿐 아니라 수반되는 비용까지 함께 보고해야 합니다.

채점 과정에서도 이전 검증 단계의 인터뷰 증거 세트가 재사용되었습니다. 따라서 해당 이전 비교와 이번 네 가지 조건의 평가는 독립된 두 표본이 아닙니다. 향후 재현 연구에는 새로운 참여자, 다른 주제 영역, 독립적인 인간 평가, 그리고 각 시스템이 볼 수 있는 정보에 대한 더 엄격한 통제가 포함되어야 합니다.

본 연구가 뒷받침하는 주장은 보편적이지는 않지만 충분히 유용합니다. 바로 이러한 홀드아웃 인터뷰 질문에서, 참여자 기반으로 그라운딩된 합성 오디언스는 테스트된 모델 버전들의 범용 응답보다 실제 인물에 더 잘 부합하는 답변을 생성했다는 사실입니다. 그리고 이러한 우위의 핵심에는 관련 증거의 활용이 있었습니다.

오디언스 그라운딩 이면의 워크플로에 대한 자세한 내용은 Minds 패널 구축 방식을 참고하시기 바랍니다. 검증 체크리스트에서는 합성 결과를 의사결정에 필요한 증거와 연결하는 방법을 설명합니다.

참조 데이터

De-identified, English Transcripts of 36 interviews

Transcription Data

CC BY 4.0