---
title: "성격 조건화는 합성 응답자를 더 뚜렷하게 만든다"
description: "영국 프로필 299개와 홀드아웃 타깃 869개를 사용한 블라인드 벤치마크에서 성격 조건화 Minds가 제네릭·인구통계 프롬프트보다 더 자주 선택되었습니다."
canonical_url: "https://getminds.ai/research/ko/personality-conditioned-synthetic-respondents-benchmark-2026"
last_updated: "2026-08-13T13:08:08.000Z"
---

# 성격 조건화는 합성 응답자를 더 뚜렷하게 만든다

성격 조건화 Minds는 길이를 맞춘 블라인드 비교의 **32.57%**에서 선택되어 인구통계 프롬프트 **25.66%**, 제네릭 프롬프트 **20.48%**를 앞섰습니다. **21.29%**는 동률이었습니다.

가장 분명한 장점은 단순히 사람처럼 들리는 것이 아니라 **특정한 사람**처럼 들리는 것이었습니다. 가치관을 표현하고, 관련된 구체성을 더하며, 사람과 사람 사이의 차이를 더 선명하게 보여줬습니다. 같은 질문을 서로 다른 오디언스 구성원이 어떻게 바라볼지 탐색하는 합성 리서치에 필요한 품질입니다.

<study-stats>



</study-stats>

## 성격 조건화가 중요한 이유

제네릭 모델은 그럴듯한 답을 만들 수 있습니다. 시장조사에는 우선순위, 선호, 세계관의 의미 있는 차이를 반영하는 답이 더 필요합니다.

이 벤치마크는 인구통계와 참여자가 직접 작성하고 사용이 허용된 성격 근거를 바탕으로 한 완전한 Mind가, 맥락이 없거나 인구통계만 있는 동일 모델보다 홀드아웃 정성 표현을 더 잘 재현하는지 평가했습니다.

타깃은 참여자가 직접 쓴 짧은 대화 시작문입니다. 설문 분포나 객관적인 “진짜” 의견이 아니라 프로필에 대한 정성적 적합도를 측정합니다.

## 3개 조건 블라인드 벤치마크

[PRISM Alignment Dataset](https://github.com/HannahKirk/prism-alignment)의 **영국 참여자 프로필 299개**(revision `a9ec82149036374768f70e132a2369a750e06bbe`)를 사용해 **관측 홀드아웃 타깃 869개**를 평가했습니다.

<table>
<thead>
  <tr>
    <th>
      조건
    </th>
    
    <th>
      참여자 맥락
    </th>
    
    <th>
      실행
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      제네릭
    </td>
    
    <td>
      맥락 없음
    </td>
    
    <td>
      Gemini 3.6 Flash 직접 실행
    </td>
  </tr>
  
  <tr>
    <td>
      인구통계
    </td>
    
    <td>
      나이, 성별, 국가, 고용, 교육
    </td>
    
    <td>
      Gemini 3.6 Flash 직접 실행
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      인구통계＋허용된 가치, 선호, 원하는 어시스턴트 행동, 훈련 프롬프트
    </td>
    
    <td>
      프로덕션 Panels API(persona, RAG, web grounding 활성화); Gemini 3.6 Flash
    </td>
  </tr>
</tbody>
</table>

타깃과 타깃 파생 데이터는 생성 맥락에서 제외했습니다. 한 명의 블라인드 Gemini 3.6 Flash 판정자가 프로필 근거, 인간 홀드아웃 참조문, 익명화된 후보 3개를 확인했습니다.

길이만으로 결과가 결정되지 않도록 판정 전에 각 후보를 인간 참조문의 단어 수에 맞게 잘랐습니다. 869개 모두 완전한 3개 조건 판정을 받았습니다.

## Minds가 가장 자주 선택되었다

<table>
<thead>
  <tr>
    <th>
      결과
    </th>
    
    <th align="right">
      제네릭
    </th>
    
    <th align="right">
      인구통계
    </th>
    
    <th align="right">
      Minds
    </th>
    
    <th align="right">
      동률
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      승자 수
    </td>
    
    <td align="right">
      178
    </td>
    
    <td align="right">
      223
    </td>
    
    <td align="right">
      <strong>
        283
      </strong>
    </td>
    
    <td align="right">
      185
    </td>
  </tr>
  
  <tr>
    <td>
      869개 중 비율
    </td>
    
    <td align="right">
      20.48%
    </td>
    
    <td align="right">
      25.66%
    </td>
    
    <td align="right">
      <strong>
        32.57%
      </strong>
    </td>
    
    <td align="right">
      21.29%
    </td>
  </tr>
  
  <tr>
    <td>
      판정 충실도 종합, 0–100
    </td>
    
    <td align="right">
      27.23
    </td>
    
    <td align="right">
      27.68
    </td>
    
    <td align="right">
      <strong>
        32.38
      </strong>
    </td>
    
    <td align="right">
      —
    </td>
  </tr>
</tbody>
</table>

Minds의 승률은 제네릭보다 **+12.04%p**(95% CI +7.13~+17.00, FDR 조정 `p < .001`), 인구통계보다 **+6.69%p**(95% CI +1.56~+11.93, `p = .020`) 높았습니다.

## 가장 강한 신호: 가치와 구체성

<table>
<thead>
  <tr>
    <th>
      질문 맥락
    </th>
    
    <th align="right">
      제네릭
    </th>
    
    <th align="right">
      인구통계
    </th>
    
    <th align="right">
      Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      가치 유도
    </td>
    
    <td align="right">
      19.30%
    </td>
    
    <td align="right">
      11.58%
    </td>
    
    <td align="right">
      <strong>
        42.81%
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      논쟁 주제 유도
    </td>
    
    <td align="right">
      18.88%
    </td>
    
    <td align="right">
      34.97%
    </td>
    
    <td align="right">
      <strong>
        38.81%
      </strong>
    </td>
  </tr>
</tbody>
</table>

Minds는 가치/성격 **36.88**, 구체성 **33.46**을 기록했습니다. 제네릭은 30.85와 21.70, 인구통계는 31.85와 23.36이었습니다. 일반성 점수도 Minds가 **63.63**(낮을수록 좋음)으로 제네릭 **73.53**, 인구통계 **72.58**보다 낮았습니다.

개인 간 응답 차이도 더 컸습니다. 평균 TF–IDF 유사도는 Minds 0.0308, 인구통계 0.0516, 제네릭 0.1108이었습니다. 인간 참조문은 0.0128로 더 다양했지만, 성격 조건화는 모델을 그 방향으로 크게 이동시켰습니다.

## 연령 코호트에서 얻은 신호

가장 일관된 향상은 고연령 코호트에서 나타났습니다. 55–64세는 보정 후 승률과 종합 점수에서 두 베이스라인을 모두 앞섰고, 65세 이상은 제네릭을 명확히 앞섰습니다. 45–54세도 종합 점수에서 인구통계 조건보다 높았습니다.

하위 그룹 결과는 탐색적이지만, 축적된 선호와 가치가 성격 조건화에 더 풍부한 신호를 제공할 가능성을 보여줍니다.

## 풍부한 답변을 공정하게 비교

Minds 전체 답변은 평균 **51.62단어**, 제네릭은 **7.86단어**, 인구통계는 **7.51단어**였습니다. 길이 매칭은 추가 세부사항이 단지 더 긴 텍스트라는 이유로 유리해지지 않게 했습니다.

실무적으로 Minds는 정성 탐색을 위한 더 풍부한 자료를 만들 수 있습니다. 다음 제품 단계는 과업에 따라 답변 깊이를 적응시키는 것입니다. 모든 조건의 비교 가능한 end-to-end 토큰 사용량은 기록되지 않아 금액 비용 비율은 제시할 수 없습니다.

## 근거를 해석하는 방법

- **항목당 판정자 1명(n=1).** Gemini 3.6 Flash의 블라인드 판정 1회이며 인간 보정은 없습니다.
- **하나의 모델 계열.** 응답 조건과 판정자 모두 Gemini 3.6 Flash를 사용했습니다.
- **정성적 타깃.** 홀드아웃 인간 문장과의 적합도를 측정하며 모집단 비율이나 구매 행동은 측정하지 않습니다.
- **end-to-end 시스템.** 성격, 검색, grounding, 응답 형식을 함께 평가했습니다.

semantic de-duplication은 **독립 ablation으로 분리되지 않았습니다**. 이 결과만으로 효과를 판단하거나 제거 근거로 삼을 수 없습니다.

이 869개 항목은 이제 제품 개발에 사용됩니다. 향후 출시 수준의 주장은 새로운 미사용 홀드아웃과 가능하면 반복 판정 또는 인간 보정이 필요합니다.

## 다음 검증

다음 ablation은 1. 현재 프로덕션 동작, 2. 인간과 비슷한 길이, 3. 인간 길이＋가치가 큰 곳에 성격 깊이를 적용하는 적응형 question routing을 비교합니다.

## 합성 리서치에 주는 의미

실무적 결론은 명확합니다. **이 블라인드 벤치마크에서 성격 조건화는 제네릭 또는 인구통계 프롬프트만 사용할 때보다 더 뚜렷한 정성 응답자를 만들었습니다.**

Minds는 오디언스 가설 생성과 스트레스 테스트, 다양한 가치 프레임 탐색, 서로 다른 사람들이 사용할 수 있는 언어 발견에 특히 유용합니다. 인간 근거를 보완하며 제네릭 모델 응답보다 더 차별화된 출발점을 제공합니다.

## 권장 인용

Minds Research Lab. 「성격 조건화는 합성 응답자를 더 뚜렷하게 만든다」. 2026년 8월 8일. [https://getminds.ai/research/ko/personality-conditioned-synthetic-respondents-benchmark-2026](https://getminds.ai/research/ko/personality-conditioned-synthetic-respondents-benchmark-2026)
