---
title: "Minds 对比 GPT-5.4 与 Claude Sonnet 5 在真实访谈回答上的表现"
description: "一项盲法定性基准测试，将基于证据强化的 Minds 与通用 GPT-5.4 及 Claude Sonnet 5 在未见过的真实人类访谈回答上进行了对比。"
canonical_url: "https://getminds.ai/research/zh/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:49.230Z"
---

# Minds 对比 GPT-5.4 与 Claude Sonnet 5 在真实访谈回答上的表现

合成受访者的实用价值不在于其能否生成看似合理的引述，而在于当被问及新问题时，能否延续真实个人的视角。

Minds Research Lab 对此进行了直接测试。我们使用了来自两个独立公开定性数据集的 22 名真实受访者的 66 个预留后续回答。将基于证据强化的 Minds 与通用 GPT-5.4、Claude Sonnet 5 以及同模型通用响应进行了对比。

Minds 在综合得分上超越 GPT-5.4 **25.49 分**，超越 Claude Sonnet 5 **30.05 分**。第二位盲法评估员复现了这两项结果。

<study-stats>



</study-stats>

## 基准测试

本研究使用了两个独立发布、公开放向授权的访谈语料库：

- [关于难民粮食不安全性问题的去标识化访谈](https://doi.org/10.6084/m9.figshare.29318549.v1)，由犹他大学研究人员发布。
- [国际激光牙科访谈逐字稿](https://doi.org/10.6084/m9.figshare.28456946.v1)，由孔敬大学研究人员发布。

对每位受访者，前期材料可用于构建合成受访者，而后续回答则作为预留数据用于评估。所有模型均接收相同的访谈问题和相同的回答形式指令。通用基础模型未接收任何受访者记忆或画像。

所有候选回答均在利用预留回答进行评分之前生成。候选回答标签经过随机化处理，以确保评估员无法得知哪个模型生成了哪个回答。

## 测试结果

<table>
<thead>
  <tr>
    <th>
      候选模型
    </th>
    
    <th align="right">
      综合得分
    </th>
    
    <th align="right">
      胜率
    </th>
    
    <th align="right">
      与 Minds 的分差
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      同模型通用响应
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

按受访者聚类的 95% 置信区间，相比 GPT-5.4 为 **+15.99 至 +34.56**，相比 Claude Sonnet 5 为 **+21.86 至 +38.12**。两个访谈语料库独立测试结果均为正向。

第二位评估员的版本复现了 **+26.13** 和 **+30.68** 分的提升。两位评估员在 81.8% 的单项回答中对胜出的候选回答达成了一致。

## Minds 的优势所在

评估标准测量的不仅是表面流畅度。它在以下维度将每个候选回答与受访者真实的后续回答进行了比较：

- 语义对齐
- 观点与价值观
- 主题与理由
- 细节具体度
- 表达语气与风格
- 长度契合度
- 通用套话程度
- 无依据的个人事实

Minds 最大的优势体现在语义对齐、观点、理由、细节具体度以及可识别的表达风格上。换言之，Minds 不仅听起来更修饰得体，而且更有可能保留受访者所关注的内容、其解释方式以及自然使用的细节。

这种优势并非由回答长度造成。在所有条件下，候选回答的平均长度约为 52 到 60 个单词。

## 为什么这不同于要求 ChatGPT 扮演特定角色

通用模型拥有极强的能力，但问题本身并不包含个人的历史信息。它只能生成针对抽象人群而言看似合理的回答。

Mind 旨在维护一个持久的研究受访者。它可以跨新问题延续经过验证的知识、先前的研究上下文以及差异化的观点。当任务依赖于对特定个人的了解而非对世界通识的掌握时，这使得规模较小或成本较低的模型能够战胜规模大得多的通用模型。

这是 Minds 以可衡量形式体现的核心论点：**人格深度与相关记忆的重要性可以超越单纯的基础模型规模。**

## 额外的定性验证

同一项更广泛的研究计划还测试了：

- [PRISM](https://arxiv.org/abs/2404.16019)，使用了 299 名未作改动的受访者以及在价值观、争议性话题和无引导提示词方面的 869 个合格人类回答。
- [NASA 口述历史数据集](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)，使用后续回答测试长篇专业访谈中的连贯性。
- 来自难民访谈语料库的独立 21 人语言群体预留样本。

在 PRISM 测试中，完整的 Minds 画像评分比通用提示词和人口统计学提示词高出约 **10 至 12 分**。在独立的语言群体预留测试中，Mind 条件的整体表现比通用响应提高了 **20.77 分**。

## 对客户研究的启示

通用基础模型有助于构思看似合理的反应。而 Minds 则针对不同的标准而设计：在整项研究中保留具备差异化的受访者特质。

这使得 Minds 特别适用于探索性访谈、概念反应测试、信息测试、异议挖掘、购买决策委员会研究、基于受访者画像的后续追问，以及将现有的研究归档资料转化为可互动的受众。

上述明确模型的测试结果涵盖了所选用的访谈数据源和模型版本。Minds Research Lab 将继续扩展跨领域、跨语言和跨问题形式的基准测试，同时确保核心对比始终锚定于真实的人类回答。

如需了解定量证据，请参阅[真实问卷基准测试](/research/survey-approximation-benchmarks-2026)。如需了解完整研究计划，请参阅[Minds Research 基准测试 2026](/research/real-world-validation-benchmarks-2026)。

## 公开基准数据源

- [犹他大学难民访谈逐字稿](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [国际激光牙科逐字稿](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [PRISM 对齐数据集](https://arxiv.org/abs/2404.16019)
- [NASA 口述历史](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## 建议引用格式

Minds Research Lab. “Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers.” 2026年8月11日. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
