合成受众在何时表现优于通用基础模型
一项留出访谈对比测试表明,在何种情况下,受访者画像和记忆机制能让合成回答优于通用的 GPT、Claude 和 Gemini 提示词。
基础模型可以对访谈问题给出看似合理的回答。但要复现特定受访者的回答,则是一项要求更为具体的任务。相比模型生成流畅通用文本的能力,受访者过往的经历、价值观和决策依据往往更加关键。
我们使用来自 22 人的 66 个留出访谈回答测试了这一差异。在双盲的受访者契合度综合评分中,包含紧凑受访者画像并能检索前期证据的合成受访者,表现优于通用的 GPT-5.4 和 Claude Sonnet 5 回答。其核心优势表现为:相对 GPT 提升 25.49 分,相对 Claude 提升 30.05 分。第二个评估模型版本也复现了这些正向对比结果。
这项对比为合成受众的一个具体应用场景提供了支持:在依赖特定证据的问题中引入相关的受访者证据。通用模型并未获得受访者的历史信息。因此,这展示的是基于事实锚定(Grounded)工作流与通用提示词之间的对比,而非相同上下文条件下模型能力的横向排名。
测试设计:前期证据与后期回答
基准测试使用了两个公开的访谈语料库,内容涵盖激光牙科从业者与难民食品安全问题。受访者早期的访谈证据被整理为紧凑的画像和可检索的记忆。每位受访者后续的 3 个回答被留出用于评估,22 位受访者共产生 66 个目标回答。
针对每个目标问题,系统生成了 4 组匿名的候选回答:画像加检索、来自相同底层 Gemini 系列模型的通用回答、通用 GPT-5.4,以及通用 Claude Sonnet 5。候选回答在打分前均已封存,评审模型在没有实验条件标签的情况下进行盲评。
评分细则评估了与真实回答的一致性、观点与价值观、论证理由、具体性、语气风格与长度契合度,同时考察了泛化程度以及未经证实的个人事实。这些均属于受访者契合度维度的指标,并不代表广告转化率、通用智能水平,或被成功模拟的人类比例。
测得的优势
参与者匹配度综合评分
22 人、66 个留出回答,由主要自动评审模型评分。通用模型未获得参与者历史,因此这不是相同上下文条件下的模型排名。
- 档案 + 检索67.66
- 通用 GPT-5.442.17
- 通用 Claude Sonnet 537.61
- 通用 Gemini35.24
| 与画像加检索条件的对比项 | 主评审综合提升 | 按受访者聚类的 95% 自助抽样区间 | 第二评审提升 |
|---|---|---|---|
| 同模型通用 Gemini 回答 | +32.42 分 | +23.93 至 +40.52 | +32.83 分 |
| 通用 GPT-5.4 | +25.49 分 | +15.99 至 +34.56 | +26.13 分 |
| 通用 Claude Sonnet 5 | +30.05 分 | +21.86 至 +38.12 | +30.68 分 |
在主评审评估下,经过事实锚定的方案综合得分为 67.66 分,通用 GPT 为 42.17 分,通用 Claude 为 37.61 分,同模型通用回答为 35.24 分。在两个评审模型版本下,两个语料库相对于指定的 GPT 和 Claude 条件均展现出正向的平均优势。
两个版本的评审模型在 81.8% 的测试项上对优胜者判定保持一致。由于两位评审均属于 Gemini 系列模型,该结果仅验证了该模型家族内部的版本敏感度,并不代表独立人类评估员或不相关模型家族之间的一致性。
为什么事实锚定能发挥作用
最直接的解释在于模型获取到了相关证据。通用模型必须依靠通用模式去填补缺失的个人背景,而具备锚定能力的受访者则可以调取已记录的经历与偏好。
面对关于职业决策的问题,早期的证据可以呈现该受访者的客观限制、既往经验以及做出某种选择的具体理由。这样生成的回答便能反映这些具体细节,而不是给出大体上合理却泛泛的建议。在基准测试中,锚定条件在具体性和理由得分上均表现更高,且被评定为泛化程度更低。
同模型通用对比在这里提供了重要参考。在保持底层模型家族不变的前提下改变画像与检索条件,证明了在该任务中增加事实锚定工作流所带来的优势。但这并未拆解出该工作流中具体哪一部分贡献了多少收益,因为画像、检索、额外上下文以及关联提示词是作为一个整体发生变化的。
这些结果印证了相关记忆机制的价值。但它们并不意味着增加更多上下文总是有效,也不意味着每条存储的事实都应该出现在每一个回答中。
该优势在何时最可信
当调研问题依赖于个人经历、先前表达过的偏好、具体经验或决策背后的缘由时,该项证据的相关性最强。跟进访谈以及探索受众为何对同一主张产生不同理解的调研,均契合这一模式。
一个实用的判断标准是:了解该受访者早期的回答,是否会从实质上改变本次回答的内容。如果是,事实锚定证据就可能具有显著价值。如果一个问题仅仅需要通用的事实性知识,本实验并未证明合成受众能优于能力强大的通用模型。
即便在访谈基准测试内部,这种优势也并非绝对存在。在一个探索性的反思型问题切片中,GPT 的得分比锚定条件高出 10.75 分。该切片仅包含来自 3 人的 5 个问题项,样本量过小,不足以确立可靠的任务排名,但它确实说明不能将平均胜出简单理解为在各类问题上全面胜出。
问卷调查需要区别分析
Against Reality 调研综述发现,基于概率的响应采集机制相比强制单选回答,能够持续改善总体分布。而在匹配了人口统计学概率提示词的基础上,详尽的画像并未在整体分布层面带来持续的额外改善。
这对于公平对比基础模型十分重要。如果将基于概率的受众与采用强制单选的通用模型进行对比,就会把事实锚定的效果与响应格式的效果混为一谈。若目的是衡量事实锚定的增量价值,两者应当遵循相同的答题约定。
Z 世代食品调研测试提供了一个更具针对性的量化示例。其后期的生产运行误差为 6.01 分,而冻结的通用概率基线误差为 6.68 分。由于通用基线采用的是历史数据,0.67 分的差距仅具描述性意义,不能据此得出合成受众在问卷调查中全面优于基础模型的宽泛结论。
本次对比留下的待解问题
本项研究样本规模较小:包含 2 个语料库、22 位受访者和 66 个回答。部分访谈被翻译为英文,这会对语气和风格的界定产生影响。模型版本和采样控制存在差异,且指定的通用模型并未获得受访者证据。一个完全对等上下文的对比,需要为每个模型提供相同的输入素材,保持响应约定一致,并同时报告最终的成本与质量表现。
此外,打分过程复用了先前验证工作中的访谈证据集。早期的对比测试与本次四种条件的评估并非两个完全独立的样本。未来的复现研究应当引入新的受访者、不同的主题领域、独立的人类评分,并对每个系统所能接触到的信息进行更严格的控制。
本研究支持的结论务实且有边界:在这些留出的访谈问题中,与所测试版本的通用模型回答相比,依托受访者事实锚定的合成受众生成的回答能够更好地契合真实人类。而相关证据的引入,正是构建这一优势的核心所在。
关于受众事实锚定背后的完整工作流,请参阅 Minds 样本库的构建方式。验证核对清单则阐述了如何将合成结果与做出决策所需的证据依据连接起来。


