我们用真实数据测试了合成受众
五个公开调查数据集揭示了合成受众的准确性,包括一项包含 301 个 Mind 的 Z 世代生产环境测试,以及用户画像锚定在何处发挥作用。
合成研究需要外部基准作为参考:来自真实人群的回答。我们最初的研究套件将合成回答与四个公开调查数据集以及两个定性基准进行了对比。随后进行的一项 Food and You 生产环境测试针对同一问题补充了实际验证:由长期留存的 Mind 组成的受众群体,究竟能在多大程度上复现真实调查的回答分布?
结果揭示了两种不同的价值来源。保留不确定性能提升调查分布的估算精度。当回答取决于个人的经历、动机和价值观时,参与者画像与相关记忆会提供额外价值。它们带来的优势因任务类型而异。
精选调查复现研究
平均分布误差
问卷和群体各不相同;PISA 使用加权结果。误差越低越好。不要将这些结果汇总为单一准确率。
- GSS 20247.53
- ANES 20248.33
- CES 20244.72
- PISA 20226.20
- Food and You 2, Wave 106.01
| 复现研究 | 公开源数据集 | 结果 |
|---|---|---|
| GSS 2024 调查复现 | GSS 2024 | 92.47% 近似度 · 平均误差 7.53 pp |
| ANES 2024 纵向复现 | ANES 2024 Time Series Study | 91.67% 近似度 · 平均误差 8.33 pp |
| CES 2024 前后测复现 | 2024 Canadian Election Study | 95.28% 近似度 · 平均误差 4.72 pp |
| PISA 2022 国际复现 | PISA 2022 Database | 93.80% 近似度 · 加权平均误差 6.20 pp |
| Food and You 2 生产环境复现 | Food and You 2, Wave 10 | 93.99% 近似度 · 平均误差 6.01 pp · Pearson 0.804 · Spearman 0.834 |
综合近似度指 100 减去平均绝对百分点误差。它衡量的是回答分布之间的差距,并不代表预测正确的个体比例达到了相同百分比。各项研究采用的测量工具与聚合细节各不相同(包括经过加权的 PISA 结果),因此不应将各行数据直接平均为一个整体准确率得分。
前四行属于最初的独立调查实验。第五行是后来在既有锁定群体上进行的产品运行。纳入该项数据旨在拓展证据全貌,但对该群体的重复测试并不能构成一项新的独立人群研究。
Z 世代:通过真实产品运行的真实问卷
英国食品标准局(UK Food Standards Agency)的 Food and You 2 调查探究了年轻人早餐、午餐和晚餐外出就餐或购买外卖的频率。此次生产环境对比测试向 301 个年龄在 16 至 24 岁之间的长期留存 Mind 提出了相同的三道问题,并将生成的分布与公开发布的青年群体结果进行了对比。每道评估题目的真实人群基数为 257。
所有计划的 903 次回答均已完成。在 21 个回答选项单元格中,平均绝对误差为 6.01 个百分点,平均分布重叠度为 78.98%。两者描述的是不同的属性:近似度转换概括了单元格的平均误差,而重叠度则反映了各分布之间共享的概率质量。
在采用相同群体与工具的前提下,8 月 18 日的运行结果较 8 月 9 日有所提升:误差从 7.33 个百分点降至 6.01 个百分点,相对降幅达 18.0%。每道题目的表现均有改善。该对比属于带有历史对照的产品回归测试,而非同期随机对照比较。
基准背景至关重要。冻结的通用概率提示词在相同单元格上录得 6.68 个百分点的误差,而等概率空假设基线则录得 7.00 个百分点。从描述性数据来看,生产环境的结果表现更好,但这些基线并未在同期重新运行。因此,仅凭近似度处于 90% 以上这一数值,并不应被直接解读为巨大的绝对优势。
Z 世代食品调查完整文章详细介绍了受众、问卷、数据出处及各题目的具体结果。英国食品标准局提供了公开参考数据集;该机构并未赞助、认可或审查本项 Minds 研究。
为什么保留不确定性能改善调查估算
在最初的四项调查实验中,相比于强制选择单一答案,采用概率回答将分布误差降低了 12.47 至 19.72 个百分点。这种改善在所有四个数据集中均有体现。
概率回答保留了分类选择所丢弃的不确定性。当在受众群体层面进行聚合时,这些概率相比于要求每个合成受访者做出单一强制选择,能够更精准地还原总体分布。
这一结果与回答收集及聚合机制相关。相同的实验并未表明详细画像能够始终优于人口统计学概率提示词。对比基准与回答形式的重要性不亚于最终得分。
其他精选验证
这些研究采用了不同的评估指标,因此计算近似度百分比会产生误导。它们是对调查证据的补充,而非直接扩大其准确率范围。
| 研究及详细结果 | 评估样本 | 报告结果 | 近似度 |
|---|---|---|---|
| PRISM 对齐研究 | 299 名参与者,869 个题目 | 32.6% 参与者契合度胜出率;人口统计学提示词为 25.7%,通用提示词为 20.5% | 不适用 |
| 预留访谈测试 | 22 人,66 个回答,两个语料库 | 相比通用提示词提升 +24.37 综合分(基于参与者聚类估算) | 不适用 |
| 知名基础模型对比 | 相同的 22 人与 66 个回答,非新群体 | 相比 GPT-5.4 高出 +25.49 分;相比 Claude Sonnet 5 高出 +30.05 分 | 不适用 |
| Spark 创意多样性 | 七项创意任务 | 平均多样性得分为 7.90/10,均匀基准为 3.14/10 | 不适用 |
Spark 评估的是创意的多样性,而非与代表性调查的一致性或对真实广告效果的预测。访谈对比采用的是自动化评判机制,而非正确模拟人群的百分比。
参与者背景信息在何处发挥作用
最初的定性测试评估了在生成过程中预先保留的后续人类回答。在 PRISM 对齐对比中,具备完整配置的 Mind 实现了 32.6% 的盲测胜出率,而人口统计学提示词为 25.7%,通用提示词为 20.5%。该 PRISM 数据集是一个外部基准,有别于 Minds 自身的方法体系。
独立访谈验证使用了两个公开语料库、22 个人以及 66 个后续回答。其报告显示,在两个语料库及第二种评判模型版本下,画像加检索机制相比通用提示词均展现出明显的正向优势。知名基础模型对比进一步探讨了该优势相对于通用 GPT 与 Claude 回答的表现。这些基线并未输入参与者的历史背景。
这些实验关注的是参与者契合度、陈述理由、细节具体性以及表达语气。它们的评判得分不应与调查分布的百分比混为一谈。这两类评估均取决于合成受访者接收到了何种证据,而且定性评估仍需要独立人工评分员的进一步验证。
证据的适用边界
最初的研究套件在其调查和定性基准中共涵盖了 1,881 名参与者。新增的 301 个 Mind 食品测试拥有独立的群体与人类参考基数,两者应当区分对待。
在报告的测试中,目标数据已在运行时输入中被预先扣留。但公开来源的数据仍可能出现在模型预训练阶段,因此仅凭运行时隔离无法完全排除所有先验接触的可能。最初的调查结果亦来自独立的测试框架,无法证明在每个产品版本中都会表现出完全一致的行为。PISA 在五个国家中均使用了英文原始题目表述。
本概述展示了此处涵盖的经过核准的证据,而非 Minds 开展过的所有实验的普查汇总。其他探索性及失败的测试需要结合其特定背景进行分析。这些发现的实际价值,在于为具体业务问题选择合适的受众、回答格式与验证方法。
了解具体工作流,请阅读Minds 研究样本库的构建方式;在判断合成结果可支持何种决策时,请参考验证清单。


