·Validation·Minds Team

GSS 2024:保留不确定性可提升问卷拟合度

一项目标隔离的 GSS 试点研究,在 360 名受访者和 17 道问题中对比了四种回答条件,将概率引出与画像价值分别进行了评估。

GSS 2024 试点研究在结构化画像概率回答下达到了 92.47% 的聚合近似度。在 17 道问题和 360 名匹配受访者中,其平均分布误差为 7.53 个百分点。更有价值的发现不仅在于高最终得分:相比于强制要求单一答案,收集概率回答显著改善了分布拟合度。

对比了哪些条件

本次评估将真实的 GSS 态度与行为回答作为留出目标。实验设置了四种条件,以区分回答格式与提供给模型的上下文:通用强制选择、通用概率、人口统计学概率以及结构化画像概率。在解封评估目标之前,候选回答均已封存。

画像包含结构化的问卷证据,而非完整的生产环境 Mind 表征。实验在隔离环境中运行。其结果仅支持所测试的回答方法,并不代表对所有生产受众均具有相同准确率。

四种条件下的结果

平均题目绝对误差

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • 通用强制选择25.74
  • 通用概率8.44
  • 人口统计学概率7.67
  • 结构化画像概率7.53
0百分点 · 越低越好30
条件平均题目绝对误差
通用强制选择25.74 pp
通用概率8.44 pp
人口统计学概率7.67 pp
结构化画像概率7.53 pp

近似度为 100 减去平均绝对百分点误差。最终得出的 92.47% 衡量的是回答分布的拟合度,而非被正确预测选项的个体受访者百分比。选项数量和聚合方法均会影响该指标。

针对通用概率与强制选择,预注册的重采样估计显示误差减少了 16.51 个百分点。这是汇报的 Bootstrap 估计值,而非对表格中取整描述性数值的直接相减。该结果单独剥离了回答格式的影响,绝不能被描述为画像或基础模型的优越性结论。

画像对比带来的增量信息

结构化画像相比人口统计学概率仅展现出微弱的描述性优势。预注册的画像提升为 0.17 个百分点,95% 置信区间为 -1.00 到 +1.31。该区间跨越了零,画像条件未达到预设的推行标准。因此,尽管概率引出提供了一个有价值的正面发现,本研究的总体结果依然呈现中性参半。

这一实际区分至关重要。通过收集概率获得的更好分布拟合度,本身并不等同于添加背景细节会有所帮助。公平的事实锚定对比必须保持回答格式一致。

团队可以从中借鉴什么

当目标是问卷回答的分布时,保留不确定性往往比将每个合成受访者简化为单一离散答案能提供更多信息。评估中应当同时保留相匹配的通用概率基线与人口统计学基线,以便让更丰富上下文带来的增量贡献清晰可见。

本研究并未建立针对任意客户受众的代表性估算、精确的个体预测,亦未对新问卷提供误差保证。在运行时隔离目标数据,同样无法证明公开数据从未出现在模型的预训练中。

证据概览将 GSS 与其他四项问卷对比进行了并列呈现。ANES 后续研究利用较早的受访者证据测试了后续回答。生产环境 Gen Z 对比则评估了一个独立的持久化 Mind 群体。

参考数据

GSS 2024