---
title: "真实调查基准：Minds 重现总体结果的精准度评估"
description: "基于 GSS、ANES、CES、PISA、PIAAC、Food and You 以及完全留出的社会科学研究对 Minds 进行的多基准验证。"
canonical_url: "https://getminds.ai/research/zh/survey-approximation-benchmarks-2026"
last_updated: "2026-08-13T13:05:30.514Z"
---

# 真实调查基准：Minds 重现总体结果的精准度评估

评估合成调查的最佳方法很简单：将其总体分布与从真实人群中收集到的答案进行对比。

Minds Research Lab 在涵盖政治、信任、教育、成人技能、日常行为和食品消费等领域的独立公开调查项目中进行了这一对比。在核心基准测试中，相较于传统的强制选择模拟，Minds 的研究路径将总体层面的误差降低了约 **7 到 20 个百分点**。

<study-stats>



</study-stats>

## 独立调查项目的评估结果

<table>
<thead>
  <tr>
    <th>
      基准
    </th>
    
    <th>
      真实人类对比数据
    </th>
    
    <th>
      回答形式
    </th>
    
    <th align="right">
      提升
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <a href="https://gss.norc.org/" rel="nofollow">
        GSS 2024
      </a>
    </td>
    
    <td>
      美国综合社会调查（GSS）官方数据
    </td>
    
    <td>
      二元、名义、顺序、多选
    </td>
    
    <td align="right">
      <strong>
        +16.51 pp
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="https://electionstudies.org/data-center/2024-time-series-study/" rel="nofollow">
        ANES 2024
      </a>
    </td>
    
    <td>
      300 名匹配的选前/选后受访者，28 个留出题目
    </td>
    
    <td>
      二元、顺序、名义
    </td>
    
    <td align="right">
      <strong>
        +12.47 pp
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="https://doi.org/10.7910/DVN/X11EP6" rel="nofollow">
        CES 2024
      </a>
    </td>
    
    <td>
      300 名匹配的选前/选后受访者，27 个问题
    </td>
    
    <td>
      二元、顺序、多选
    </td>
    
    <td align="right">
      <strong>
        +19.72 pp
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="https://www.oecd.org/en/data/datasets/pisa-2022-database.html" rel="nofollow">
        PISA 2022
      </a>
    </td>
    
    <td>
      来自五个国家的 600 名学生，十个问题
    </td>
    
    <td>
      国际顺序量表
    </td>
    
    <td align="right">
      <strong>
        +14.86 pp
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      完全未见的社会科学研究
    </td>
    
    <td>
      跨越四项完整留出研究的 1,468 人
    </td>
    
    <td>
      四至八选项的顺序量表
    </td>
    
    <td align="right">
      <strong>
        对比通用模型 +15.43 pp
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="https://www.food.gov.uk/research/food-and-you-2/food-and-you-2-wave-10" rel="nofollow">
        Food and You 2
      </a>
    </td>
    
    <td>
      完整 301 个 Mind 产品级复现
    </td>
    
    <td>
      英国青年饮食行为
    </td>
    
    <td align="right">
      <strong>
        +7.27 pp
      </strong>
    </td>
  </tr>
</tbody>
</table>

数值为正的提升代表平均绝对百分点误差更低。GSS、ANES、CES 和 PISA 的估计值包含了不包含零的聚类 95% 不确定性区间。

## 跨问题类型的泛化能力

该结果并不局限于人们熟悉的五点意见量表。

在 [CES 2024](https://cces.gov.harvard.edu/) 中，Minds 将二元问题的准确度提升了 **22.44 个百分点**，顺序问题提升了 **18.23 个百分点**，两组真实的多选问题组提升了 **19.66 个百分点**。多选问题的结果至关重要，因为复选框问题不同于普通的单选问题：每个选项都有其各自的总体普及率。

[OECD PISA 2022](https://www.oecd.org/en/data/datasets/pisa-2022-database.html) 测试将这一结果扩展到了英国、德国、日本、墨西哥和美国。每个国家以及每个测试的问题类别都有所改善，加权与未加权分析的结果保持一致。

[OECD 成人技能调查 2023](https://www.oecd.org/en/data/datasets/piaac-2nd-cycle-database.html)（PIAAC）增加了智利、波兰、新加坡、日本和美国，其中包括精确的 0 到 10 评分问题。在这项国际基准测试中，相比通用概率基线，加入总体与人口统计学背景将误差降低了 **1.59 个百分点**。

## 使用 301 个 Mind 进行的产品级复现

随后，通过实际的 Minds 样本库引擎对该方法进行了验证，使用的是与 [Food and You 2, Wave 10](https://www.food.gov.uk/research/food-and-you-2/food-and-you-2-wave-10) 完全相同的问题，以及匹配的 301 名英国 Z 世代食品消费者群体。

最终的产品运行将平均误差从 **14.60 个百分点降至 7.33 个百分点**，提升了 **7.27 个百分点**。所有三个问题的表现均有所提升，且样本库全程输出了有效的结构化回答。

这一点非常重要，因为孤立的基准测试只能证明某个设想可行；而产品级复现则表明，真实群体、样本库执行、回答契约和数据聚合能够共同保持这种改善效果。

## 为什么分布误差是核心指标

仅靠相关性可能会让模型因将常见答案排在罕见答案之前而获得高分，但其预测的百分比可能仍存在很大偏差。因此，Minds Research Lab 将平均绝对百分点误差作为主要的总体评估指标。

例如，如果真实人群选择某个选项的比例为 40%，而合成样本库估计为 34%，则误差为 6 个百分点。我们在每个选项上计算该误差，然后在问题或研究层面上取平均值。数值越低越好，且单位易于理解。

本研究还区分了两个不同的目标：

- **总体忠实度（Population fidelity）：** 聚合分布与调查结果的吻合程度。
- **个体忠实度（Individual fidelity）：** 单个建模个体与其真实回答的吻合程度。

Minds 同时支持这两者，但它们是分别进行评估的，而不是合并成一个宣传用的单一准确率数字。

## 完整的基准验证体系，而非一次性演示

验证项目特意从开发数据集延伸至不重叠的研究、完全未见的研究留出集、独立的国家级调查、国际调查、不同的回答形式，并最终落实到部署上线的产品路径。

在查看留出的真实人类结果之前，就已经生成了关键的对比数据。问题、选项、受访者子集和评估指标均已预先固定。这使得所报告的提升是对真实结果的严谨对比，而非挑选恰好表现良好的样例进行演示。

## 研究团队可以从中获得什么

研究团队可以使用 Minds 在研究流程早期预估可能的总体模式、在实地调研前对比概念、测试问卷，并确定在何处招募真实受访者能产生最大的附加信息价值。

这种经过验证的方法已经成为支持的结构化研究中 Minds 样本库技术栈的一部分。团队可以将其与可复用的受众群体、透明的来源依据、定性追问以及可导出的研究成果相结合。

如需了解更广泛的项目信息，请参阅 [Minds Research Benchmark 2026](/research/real-world-validation-benchmarks-2026)。如需了解个体访谈忠实度，请参阅 [Minds 与基础模型对比](/research/minds-vs-foundation-models-qualitative-2026)。

## 公开基准数据来源

- [General Social Survey](https://gss.norc.org/)
- [ANES 2024 Time Series](https://electionstudies.org/data-center/2024-time-series-study/)
- [Cooperative Election Study 2024](https://doi.org/10.7910/DVN/X11EP6)
- [PISA 2022 Database](https://www.oecd.org/en/data/datasets/pisa-2022-database.html)
- [PIAAC 2023 Database](https://www.oecd.org/en/data/datasets/piaac-2nd-cycle-database.html)
- [Food and You 2, Wave 10](https://www.food.gov.uk/research/food-and-you-2/food-and-you-2-wave-10)

## 建议引用格式

Minds Research Lab. “Real Survey Benchmarks: How Closely Minds Reproduces Population Results.” August 11, 2026. [https://getminds.ai/research/survey-approximation-benchmarks-2026](https://getminds.ai/research/survey-approximation-benchmarks-2026)
