·Validation·Minds Team

ANES 2024:合成回答与后续人类回答的对比研究

一项基于 ANES 选前/选后数据的对比测试,针对 300 名匹配受访者的 28 项后续回答展开评估,分别呈现响应格式与受访者背景锚定的不同结果。

在使用检索档案概率回答时,ANES 2024 对比测试达到了 91.67% 的总体近似度,即平均分布误差为 8.33 个百分点。其中测得最显著的改进来自概率诱导:相较于通用强制选择,通用概率回答将误差降低了 12.47 个百分点。

不同于那些重构已提供给模型之答案的对比,本研究设计利用选前收集的受访者证据,评估其在选后留出集中未曾见过的后续回答。

纵向测试设计

样本包含 300 名匹配受访者和 28 项后续问题。真实人类目标回答在运行时生成阶段被完全隔离,候选方案在评估前均已封存。测试条件分别设定为:通用强制回答、通用概率、人口统计概率,以及结合检索档案证据的概率回答。

前序证据可以提供有关受访者的背景信息,但这并不等同于预先获知他们后续的实际回答。这种时间上的前后隔离,使其成为一次极具价值的检验,用以验证先验信息是否能够有效迁移至后续问卷。

分布结果

题目平均绝对误差

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • Generic forced choice22.782
  • Generic probability10.312
  • Demographic probability8.263
  • Retrieved-profile probability8.330
0百分点 · 越低越好30
测试条件题目平均绝对误差
Generic forced choice22.782 pp
Generic probability10.312 pp
Demographic probability8.263 pp
Retrieved-profile probability8.330 pp

最终近似度转换为 100 减去 8.33,得出 91.67%。该指标描述的是各回答单元格的平均分布误差,既不代表个体预测准确率,也不代表对选举结果的预测。

在通用概率与通用强制选择的对比中,记录到的改进达 12.47 个百分点。在这一对照项下,所有受评题目的表现均未出现超过两个百分点的倒退。因此,回答格式带来的提升效果并不局限于单道孤立题目。

背景锚定与群体聚合是两个不同课题

相比人口统计概率提示词,检索档案并未在群体层面改善平均绝对误差。记录的误差差异为 +0.046 个百分点,且置信区间跨越了零点。描述性结果表格同样显示,人口统计概率表现略微领先。

档案信息适度改善了个体 Brier 分数和精确匹配率,但轻微削弱了群体层面的校准度。这两种结果完全可以并存:预测个人的回答与重构受众的分布是截然不同的目标。如果仅挑拣有利指标进行呈现,将会曲解这项研究的真实结论。

该实验的总体结果好坏参半。它支持了概率诱导的有效性,但未能证实档案在总体聚合层面具有核心增量效益。

启示与局限

团队在对比合成受众之前,应先明确自身的评估目标。个体回答任务需要个体层面的评估指标;而受众分布任务则需要总体层面的校准。在一项指标上的良好得分无法替代另一项指标。

这是一个使用结构化选前证据的独立测试环境,而非经过完整训练的生产环境 Mind 链路。所评估的样本及后续题目并不能证明其对所有政治受众或问卷调查工具均具备普遍有效性。运行时的留出验证也无法完全排除模型在预训练阶段接触过公开数据的可能性。

GSS 试点研究 提供了另一种回答格式的对比分析。CES 研究 将这一测评工具拓展到了多种题型。证据总览 则对它们各自的分数与适用范围进行了独立区分。

参考数据

ANES 2024