---
title: "人格条件化让合成受访者更具区分度"
description: "在覆盖299个英国档案和869个留出目标的盲测基准中，人格条件化 Minds 比通用或人口统计提示更常被选中。"
canonical_url: "https://getminds.ai/research/zh/personality-conditioned-synthetic-respondents-benchmark-2026"
last_updated: "2026-08-13T13:08:02.107Z"
---

# 人格条件化让合成受访者更具区分度

在人格条件化、长度匹配的盲测比较中，Minds 在 **32.57%** 的项目中被选中，高于人口统计提示的 **25.66%** 和通用提示的 **20.48%**；**21.29%** 为平局。

最明显的优势不只是“像人”，而是像一个**具体的人**：表达其价值观、加入相关细节，并更清楚地呈现人与人之间的差异。当合成研究需要探索不同受众如何理解同一个问题时，这正是关键能力。

<study-stats>



</study-stats>

## 为什么人格条件化很重要

通用模型可以生成看似合理的回答，但市场研究通常需要更进一步：回答应体现优先级、偏好和世界观上的真实差异。

本基准检验完整的 Mind——基于人口统计信息以及由参与者本人撰写且获准使用的人格证据——是否比无上下文或仅有人口统计信息的同一模型更好地复现留出的定性表达。

目标是参与者本人写下的简短对话开场，而不是调查分布或客观“真实”的观点。因此，本研究衡量的是定性档案匹配度。

## 三组盲测基准

我们使用 [PRISM Alignment Dataset](https://github.com/HannahKirk/prism-alignment) 中的 **299个英国参与者档案**，固定在 revision `a9ec82149036374768f70e132a2369a750e06bbe`。评分集包含 **869个已观察留出目标**。

<table>
<thead>
  <tr>
    <th>
      组别
    </th>
    
    <th>
      参与者上下文
    </th>
    
    <th>
      执行方式
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      通用
    </td>
    
    <td>
      无参与者上下文
    </td>
    
    <td>
      直接调用 Gemini 3.6 Flash
    </td>
  </tr>
  
  <tr>
    <td>
      人口统计
    </td>
    
    <td>
      年龄、性别、国家、就业和教育
    </td>
    
    <td>
      直接调用 Gemini 3.6 Flash
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      人口统计＋获准使用的价值观、偏好、期望助手行为和训练提示
    </td>
    
    <td>
      生产 Panels API，启用 persona、RAG 和 web grounding；Gemini 3.6 Flash
    </td>
  </tr>
</tbody>
</table>

目标及其派生数据均不得进入生成上下文。一名盲评 Gemini 3.6 Flash 裁判查看档案证据、真人留出参考和三个匿名候选。

为避免长度决定结果，每个候选在评审前都截断到真人参考的词数。869个目标全部完成三组评审。

## Minds最常被选中

<table>
<thead>
  <tr>
    <th>
      结果
    </th>
    
    <th align="right">
      通用
    </th>
    
    <th align="right">
      人口统计
    </th>
    
    <th align="right">
      Minds
    </th>
    
    <th align="right">
      平局
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      胜出数
    </td>
    
    <td align="right">
      178
    </td>
    
    <td align="right">
      223
    </td>
    
    <td align="right">
      <strong>
        283
      </strong>
    </td>
    
    <td align="right">
      185
    </td>
  </tr>
  
  <tr>
    <td>
      869项中的占比
    </td>
    
    <td align="right">
      20.48%
    </td>
    
    <td align="right">
      25.66%
    </td>
    
    <td align="right">
      <strong>
        32.57%
      </strong>
    </td>
    
    <td align="right">
      21.29%
    </td>
  </tr>
  
  <tr>
    <td>
      裁判保真综合分，0–100
    </td>
    
    <td align="right">
      27.23
    </td>
    
    <td align="right">
      27.68
    </td>
    
    <td align="right">
      <strong>
        32.38
      </strong>
    </td>
    
    <td align="right">
      —
    </td>
  </tr>
</tbody>
</table>

Minds 的胜出率比通用提示高 **+12.04个百分点**（95% CI +7.13至+17.00；FDR校正 `p < .001`），比人口统计提示高 **+6.69个百分点**（95% CI +1.56至+11.93；`p = .020`）。

## 最强信号：价值观与具体性

<table>
<thead>
  <tr>
    <th>
      问题语境
    </th>
    
    <th align="right">
      通用
    </th>
    
    <th align="right">
      人口统计
    </th>
    
    <th align="right">
      Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      价值观引导
    </td>
    
    <td align="right">
      19.30%
    </td>
    
    <td align="right">
      11.58%
    </td>
    
    <td align="right">
      <strong>
        42.81%
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      争议议题引导
    </td>
    
    <td align="right">
      18.88%
    </td>
    
    <td align="right">
      34.97%
    </td>
    
    <td align="right">
      <strong>
        38.81%
      </strong>
    </td>
  </tr>
</tbody>
</table>

Minds 在价值观/人格上得分 **36.88**，具体性得分 **33.46**；通用组为30.85和21.70，人口统计组为31.85和23.36。Minds 的泛化程度得分也更低——**63.63**，越低越好——而通用组为 **73.53**、人口统计组为 **72.58**。

人与人之间的回答也更有差异。平均 TF–IDF 相似度为：Minds 0.0308、人口统计0.0516、通用0.1108。真人参考为0.0128，仍然更加多样，但人格条件化显著推动模型接近这一模式。

## 有价值的年龄组信号

最一致的提升出现在较高年龄组。55–64岁组在校正后的胜出率和综合分上均超过两个基线；65岁以上组明显超过通用提示；45–54岁组在综合分上超过人口统计提示。

这些子组结果仍属探索性，但说明更丰富、长期形成的偏好和价值观可能为人格条件化提供更多有效信号。

## 更丰富的回答，公平的比较

Minds 完整回答平均 **51.62词**，通用组为 **7.86词**，人口统计组为 **7.51词**。长度匹配确保额外细节不会仅因为文本更多而获胜。

在实践中，Minds 可以为定性探索提供更丰富的材料。下一步产品工作是让回答深度随任务自适应。现有产物未记录所有组可比较的端到端 token 使用量，因此不支持货币成本比。

## 如何理解这些证据

- **每项一名裁判（n=1）。** 使用一次 Gemini 3.6 Flash 盲评，没有真人校准。
- **同一模型系列。** 回答组和裁判最终都使用 Gemini 3.6 Flash。
- **定性目标。** 衡量与留出真人文本的匹配，而非总体比例或购买行为。
- **端到端系统。** 人格、检索、grounding 和回答格式共同被评估。

语义去重**没有在独立消融中被隔离测试**。本基准不能确定其影响，也不能作为移除它的依据。

这869个项目现在用于指导产品开发。未来任何发布级声明都需要新的、未触碰的留出集，最好加入重复裁判或真人校准。

## 下一步测试

下一项消融将比较：1. 当前生产行为；2. 接近真人的回答长度；3. 真人长度加自适应问题路由，在最有价值的地方应用人格深度。

## 对合成研究意味着什么

实际结论很清楚：**在这项盲测基准中，人格条件化比仅使用通用或人口统计提示产生了更具区分度的定性受访者。**

这使 Minds 特别适合生成和压力测试受众假设、探索不同价值框架，以及发现不同人群可能使用的语言。它补充真人证据，并为研究团队提供比通用模型回答更有差异化的起点。

## 建议引用

Minds Research Lab。《人格条件化让合成受访者更具区分度》。2026年8月8日。[https://getminds.ai/research/zh/personality-conditioned-synthetic-respondents-benchmark-2026](https://getminds.ai/research/zh/personality-conditioned-synthetic-respondents-benchmark-2026)
