---
title: "실제 인터뷰 답변에서 GPT-5.4 및 Claude Sonnet 5 대비 Minds의 성과"
description: "Hold-out 인간 인터뷰 답변을 바탕으로 근거 기반 Minds와 범용 GPT-5.4 및 Claude Sonnet 5를 비교한 블라인드 질적 벤치마크."
canonical_url: "https://getminds.ai/research/ko/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:41.030Z"
---

# 실제 인터뷰 답변에서 GPT-5.4 및 Claude Sonnet 5 대비 Minds의 성과

가상 응답자(synthetic respondent)의 유용성을 결정짓는 것은 그럴듯한 인용구를 생성할 수 있는지 여부가 아닙니다. 새로운 질문을 받았을 때 실제 인물의 관점을 지속해서 이어나갈 수 있는지 여부입니다.

Minds Research Lab은 이를 직접 검증했습니다. 두 개의 독립적인 공개 질적 데이터셋에서 추출한 실제 인터뷰 대상자 22명의 Hold-out 이후 답변 66개를 활용했습니다. 근거 기반의 Minds를 범용 GPT-5.4, Claude Sonnet 5 및 동일 모델의 범용 응답과 비교했습니다.

Minds는 GPT-5.4를 **종합 점수 25.49점**, Claude Sonnet 5를 **30.05점** 차이로 앞섰습니다. 두 번째 블라인드 평가자 역시 두 결과 모두를 재현했습니다.

<study-stats>



</study-stats>

## 벤치마크

본 연구에서는 독립적으로 출판되고 오픈 라이선스가 부여된 두 개의 인터뷰 말뭉치(corpora)를 사용했습니다:

- [난민 식량 불안정에 관한 비식별화 인터뷰](https://doi.org/10.6084/m9.figshare.29318549.v1) (유타 대학교 연구진 출판)
- [국제 레이저 치의학 인터뷰 녹취록](https://doi.org/10.6084/m9.figshare.28456946.v1) (콘켄 대학교 연구진 출판)

각 참가자에 대해 앞부분의 자료는 가상 응답자를 구성하는 데 활용되었고, 이후의 답변은 평가를 위해 별도로 보류(Hold-out)되었습니다. 모델들은 동일한 인터뷰 질문과 동일한 답변 형식 지침을 받았습니다. 범용 파운데이션 모델에는 참가자 기억이나 프로필이 제공되지 않았습니다.

모든 후보 답변은 보류된 답변이 점수 측정에 사용되기 전에 생성되었습니다. 평가자가 어떤 모델이 어떤 답변을 생성했는지 알 수 없도록 후보 라벨을 무작위로 배정했습니다.

## 결과

<table>
<thead>
  <tr>
    <th>
      후보
    </th>
    
    <th align="right">
      종합 점수
    </th>
    
    <th align="right">
      승률
    </th>
    
    <th align="right">
      Minds 대비 차이
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      동일 모델 범용 응답
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

참가자 클러스터 기준 95% 신뢰구간은 GPT-5.4 대비 **+15.99 ~ +34.56점**, Claude Sonnet 5 대비 **+21.86 ~ +38.12점**이었습니다. 두 인터뷰 말뭉치 모두 독립적으로 긍정적인 결과를 보였습니다.

두 번째 평가자 평가에서도 **+26.13점** 및 **+30.68점**의 상승 폭이 재현되었습니다. 두 평가자는 개별 답변의 81.8%에서 승리 후보에 동의했습니다.

## Minds가 우위를 보인 영역

평가 루브릭은 표면적인 유창함 그 이상을 측정했습니다. 각 후보 답변을 실제 해당 인물의 이후 답변과 다음 항목에 걸쳐 비교했습니다:

- 의미적 일치성 (Semantic alignment)
- 관점 및 가치관 (Viewpoint and values)
- 주제 및 이유 (Themes and reasons)
- 구체성 (Specificity)
- 어조 및 스타일 (Voice and style)
- 적절한 길이 (Length fit)
- 범용성/상투성 (Genericness)
- 근거 없는 개인적 사실 (Unsupported personal facts)

Minds의 가장 큰 강점은 의미적 일치성, 관점, 이유, 구체성, 그리고 고유한 어조에서 나타났습니다. 다시 말해, Minds는 단순히 답변을 보기 좋게 다듬은 것에 그치지 않았습니다. 해당 인물이 중요하게 생각하는 바, 이를 설명하는 방식, 그리고 자연스럽게 사용하는 세부 정보를 보존할 가능성이 더 높았습니다.

이러한 우위는 답변 길이에 따른 착시 현상이 아니었습니다. 후보 답변은 모든 조건에서 평균 약 52~60단어였습니다.

## ChatGPT에 페르소나처럼 행동하도록 요청하는 것과의 차이점

범용 모델은 뛰어난 성능을 발휘하지만, 질문 자체에는 특정 개인의 이력이 포함되어 있지 않습니다. 따라서 추상적인 누군가에게 그럴듯한 답변을 생성해야만 합니다.

Mind는 지속적인 리서치 참가자를 유지하도록 설계되었습니다. 검증된 지식, 이전 리서치 맥락, 그리고 차별화된 관점을 새로운 질문 전반에 걸쳐 이어나갈 수 있습니다. 이를 통해 작업의 성패가 세상에 대한 지식보다 특정 개인을 이해하는 데 달려 있을 때, 더 작은 규모나 적은 비용의 모델이 훨씬 더 큰 범용 모델을 능가할 수 있게 됩니다.

이는 측정 가능한 형태로 입증된 Minds의 핵심 명제입니다: **페르소나의 깊이와 관련 기억이 단순한 파운데이션 모델의 규모보다 더 중요할 수 있습니다.**

## 추가적인 정성적 검증

동일한 광범위한 연구 프로그램에서 다음 항목도 함께 검증했습니다:

- 가치관, 논란이 되는 주제, 가이드 없는 프롬프트에 걸쳐 299명의 비수정 참가자와 869개의 적격 인간 응답을 활용한 [PRISM](https://arxiv.org/abs/2404.16019).
- 장문 형태의 전문 인터뷰 전반에 걸친 연속성을 검증하기 위해 후속 답변을 활용한 [NASA Oral History collection](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/).
- 난민 인터뷰 말뭉치에서 추출한 별도의 21인 언어 코호트 Hold-out.

PRISM 전체에 걸쳐 완성된 Minds 프로필은 범용 및 인구통계학적 프롬프팅보다 약 **10~12점 높은 점수**를 기록했습니다. 별도의 언어 코호트 Hold-out에서 Mind 조건은 전체적으로 범용 응답 대비 **20.77점** 향상되었습니다.

## 고객 리서치에 가지는 의미

범용 파운데이션 모델은 그럴듯한 반응을 브레인스토밍하는 데 유용합니다. 반면 Minds는 조사 전반에 걸쳐 차별화된 참가자를 보존한다는 다른 기준을 목표로 설계되었습니다.

이러한 특성 덕분에 Minds는 탐색적 인터뷰, 콘셉트 반응 조사, 메시지 테스트, 반론 발굴, 구매 결정 위원회 조사, 페르소나 기반 후속 연구, 그리고 기존 리서치 아카이브를 대화형 오디언스로 전환하는 작업에 특히 적합합니다.

명시된 모델 결과는 테스트된 인터뷰 출처 및 모델 버전에 적용됩니다. Minds Research Lab은 실제 인간의 답변에 핵심 비교 기준을 두면서, 도메인, 언어, 질문 형태 전반으로 벤치마크를 계속 확장해 나가고 있습니다.

정량적 검증 자료는 [Real Survey Benchmarks](/research/survey-approximation-benchmarks-2026)에서 확인하세요. 전체 연구 프로그램은 [Minds Research Benchmark 2026](/research/real-world-validation-benchmarks-2026)에서 확인하실 수 있습니다.

## 공개 벤치마크 출처

- [유타 대학교 난민 인터뷰 녹취록](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [국제 레이저 치의학 인터뷰 녹취록](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [PRISM Alignment Dataset](https://arxiv.org/abs/2404.16019)
- [NASA Oral Histories](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## 권장 인용 방식

Minds Research Lab. “Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers.” August 11, 2026. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
