---
title: "Minds 研究实验室"
description: "来自 Minds 研究实验室的基准研究，涵盖合成受众、问卷拟合、持续性 AI 受访者以及多智能体多样性。"
canonical_url: "https://getminds.ai/research/zh/overview"
last_updated: "2026-08-13T13:04:17.510Z"
---

# Minds 研究实验室

我们用现实检验合成受访者。我们的基准测试项目将 Minds 与官方调查分布、真实访谈参与者后续的回答、简单同模型基线以及领先的基座模型进行了对比。

## 最新研究

### [Minds 2026年研究基准：真实人类对比测试](/research/real-world-validation-benchmarks-2026)

涵盖 GSS、ANES、CES、PISA、PIAAC、Food and You、PRISM、NASA 口述历史以及两个公开定性语料库的完整验证项目。Minds 将调查分布误差降低了多达 **19.72 个百分点**，并在保留的定性回答上击败了通用基座模型。

### [真实调查基准：Minds 复现总体结果的精准度评估](/research/survey-approximation-benchmarks-2026)

针对二元、顺序、名义、多选及 0 至 10 分问题的独立调查测试。核心改进在美国全国调查、五国学生数据、成人技能数据以及真实的 301-Mind 产品受访小组中均得到了复现。

### [Minds 与 GPT-5.4 及 Claude Sonnet 5 在真实访谈回答上的对比](/research/minds-vs-foundation-models-qualitative-2026)

在来自 22 位真人的 66 个后续回答中，Minds 以 **25.49 分**的优势击败通用 GPT-5.4，以 **30.05 分**的优势击败 Claude Sonnet 5。第二位盲审评估员复现了该排名。

### [Spark 效应：多智能体 AI 中的创意思维多样性](/research/spark-effect-creative-diversity-multi-agent-ai)

相比统一提示词，设定角色条件的智能体实现了 **+4.1 分的多样性提升**，缩短了与人类专家之间 82% 的差距。[在 arXiv 上阅读论文](https://arxiv.org/abs/2510.15568)。

## 研究领域

### 合成总体保真度

我们衡量合成受访者小组是否能在不同问题、人群、国家和回答形式中复现真实的回答分布。

### 持续性定性受访者

我们测试构建的模型化受访者能否在后续的访谈问题中，延续真实个人的观点、理由、具体细节和表达风格。

### 多智能体多样性

我们研究差异化的智能体如何比统一提示的基座模型输出更广泛、重复性更低的视角。

### 评估与基准测试

我们使用保留的人类数据证据、简单基线、匿名候选排序、重复评估员以及可解释的指标，以确保产品研究具备可证伪性。

## 公开基准数据源

我们的验证项目使用了独立发布的公开数据源，包括 [综合社会调查 (GSS)](https://gss.norc.org/)、[ANES](https://electionstudies.org/data-center/2024-time-series-study/)、[合作选举研究 (CES)](https://doi.org/10.7910/DVN/X11EP6)、[PISA](https://www.oecd.org/en/data/datasets/pisa-2022-database.html)、[PIAAC](https://www.oecd.org/en/data/datasets/piaac-2nd-cycle-database.html)、[Food and You 2](https://www.food.gov.uk/research/food-and-you-2/food-and-you-2-wave-10)、[PRISM](https://arxiv.org/abs/2404.16019) 以及 [NASA 口述历史](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)。

了解公开的产品方法，请阅读 [Minds 如何构建合成研究小组](/research/methodology)。
