---
title: "実際のインタビュー回答におけるMindsとGPT-5.4およびClaude Sonnet 5の比較"
description: "根拠に基づいたMindsと汎用GPT-5.4およびClaude Sonnet 5を、評価用に取り置かれた実際の人間のインタビュー回答を用いて比較したブラインド定性ベンチマーク。"
canonical_url: "https://getminds.ai/research/ja/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:50.987Z"
---

# 実際のインタビュー回答におけるMindsとGPT-5.4およびClaude Sonnet 5の比較

合成対象者（synthetic respondent）が有用であるかどうかは、もっともらしいコメントを生成できるかどうかにかかっているのではありません。新しい質問をされた際に、実在の人物の視点を一貫して維持できるかどうかが重要なのです。

Minds Research Labはこれを直接検証しました。2つの独立した公開定性データセットから、22人の実際のインタビュー回答者による66件の後半回答を評価用（held-out）として抽出して使用しました。エビデンスに基づいたMindsを、汎用のGPT-5.4、Claude Sonnet 5、および同一モデルによる汎用回答と比較しました。

MindsはGPT-5.4を**総合スコアで25.49ポイント**、Claude Sonnet 5を**30.05ポイント**上回りました。2人目のブラインド評価者も双方の結果を再現しました。

<study-stats>



</study-stats>

## ベンチマークの概要

本研究では、独立して公開されているオープンライセンスの2つのインタビューコーパスを使用しました。

- [難民の食料不安に関する匿名化インタビュー](https://doi.org/10.6084/m9.figshare.29318549.v1)（ユタ大学の研究者により公開）
- [レーザー歯科治療に関する国際インタビュー書き起こし](https://doi.org/10.6084/m9.figshare.28456946.v1)（コンケン大学の研究者により公開）

すべての対象者において、前半の発言データを合成対象者の構築に使用し、後半の回答は評価用として取り置かれました。各モデルには同一のインタビュー質問と回答形式の指示が与えられました。汎用基盤モデルには、対象者のメモリーやプロファイルは一切提供されませんでした。

評価用回答を使用した採点を行う前に、すべての候補回答が生成されました。候補のラベルはランダム化され、評価者がどのモデルがどの回答を生成したか分からないように配慮されました。

## 結果

<table>
<thead>
  <tr>
    <th>
      候補
    </th>
    
    <th align="right">
      総合スコア
    </th>
    
    <th align="right">
      勝率
    </th>
    
    <th align="right">
      Mindsとの差
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      同一モデルの汎用回答
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

対象者でクラスタリングした95%信頼区間は、GPT-5.4に対して**+15.99〜+34.56**、Claude Sonnet 5に対して**+21.86〜+38.12**でした。どちらのインタビューコーパスにおいても独立してプラスの結果を示しました。

2人目の評価者バージョンでも、**+26.13**および**+30.68**ポイントの向上が再現されました。2人の評価者は、個々の回答における勝利候補の一致率が81.8%に達しました。

## Mindsが優位性を示した領域

評価ルーブリックは表面的な流暢さ以上の要素を測定しました。各候補回答を本人の実際の後半回答と比較し、以下の項目を評価しました。

- 意味的整合性
- 視点と価値観
- テーマと理由
- 具体性
- 語り口（ボイス）とスタイル
- 長さの適合性
- 汎用性（一般的すぎる度合い）
- 裏付けのない個人的な事実（ハルシネーション）

Mindsの最も大きな強みは、意味的整合性、視点、理由、具体性、そして本人とわかる語り口に現れました。言い換えれば、Mindsは単に洗練された文章を作成しただけではありません。その人物が何を重視しているか、どのように説明するか、そして自然にどのような詳細を用いるかをより高い精度で保持していたのです。

この優位性は、文章の長さによる影響ではありません。全条件における候補回答の平均文字数（単語数）は、概ね52〜60語の範囲内でした。

## ChatGPTにペルソナを演じるよう指示することとの違い

汎用モデルは非常に優れた能力を持っていますが、質問文のみではその人物の背景履歴を把握できません。そのため、抽象的な誰かにとって「もっともらしい」回答を生成せざるを得ません。

一方、Mindは永続的な調査対象者を維持するように構築されています。検証済みの知識、過去の調査文脈、差別化された視点を新しい質問にわたって引き継ぐことができます。これにより、世界に関する一般的な知識ではなく「その人物を知ること」が求められるタスクにおいて、より小型または低コストのモデルが、はるかに大規模な汎用モデルを上回ることが可能になります。

これこそが、測定可能な形式で示されたMindsの核心的な仮説です。すなわち、**「パーソナリティの深さと関連するメモリーは、生の基盤モデルのスケール（規模）よりも重要になり得る」**ということです。

## その他の定性的な検証結果

同様の広範な研究プログラムにおいて、以下についても検証が行われました。

- [PRISM](https://arxiv.org/abs/2404.16019)：価値観、論争を呼ぶトピック、自由回答形式のプロンプトにおいて、299人の未編集の対象者および869件の適合する人間の回答を使用。
- [NASA Oral Historyコレクション](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)：長文の専門的なインタビューにおける一貫性を検証するため、後半の回答を使用。
- 難民インタビューコーパスから抽出した、別途21人で構成される言語コホートの評価用データセット。

PRISM全体において、完全なMindsプロファイルは、汎用プロンプトおよび属性（デモグラフィック）指示プロンプトと比較して約**10〜12ポイント高いスコア**を記録しました。別の言語コホートの評価用データセットでは、Mind条件は汎用回答と比較して全体で**20.77ポイント**向上しました。

## 顧客調査（リサーチ）における意義

汎用基盤モデルは、もっともらしい反応のブレインストーミングに役立ちます。しかし、Mindsは異なる基準のために設計されています。それは、調査全体を通じて「固有の特徴を持つ対象者」の再現性を高精度に維持することです。

これにより、Mindsは探索的インタビュー、コンセプト評価、メッセージテスト、反対意見の抽出、購買意思決定組織（バイイング・コミッティ）の研究、ペルソナに基づくフォローアップ調査、さらには既存のリサーチアーカイブをインタラクティブなオーディエンスへと変換する試みに特に適しています。

指定されたモデルでの検証結果は、テスト対象となったインタビューソースおよびモデルバージョンに基づくものです。Minds Research Labは、実際の人間の回答を中心とした検証軸を保ちながら、多様な領域、言語、質問形式へとベンチマークの拡張を継続しています。

定量的なエビデンスについては[Real Survey Benchmarks](/research/survey-approximation-benchmarks-2026)を、研究プログラム全体の概要については[Minds Research Benchmark 2026](/research/real-world-validation-benchmarks-2026)をご覧ください。

## 公開ベンチマークソース

- [ユタ大学 難民インタビュー書き起こし](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [レーザー歯科治療 国際インタビュー書き起こし](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [PRISM Alignment Dataset](https://arxiv.org/abs/2404.16019)
- [NASA Oral Histories](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## 引用の推奨表記

Minds Research Lab. “Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers.” 2026年8月11日. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
