·Validation·Minds Team

CES 2024:跨多种题型的问卷拟合度研究

一项 CES 对比研究对 300 名匹配受访者在 27 道二元题、序数题及多选题上的表现进行了评估,区分了总体拟合度与个体预测。

CES 2024 测试在采用画像概率回答时达到了 95.28% 的总体拟合度,相当于 4.72 个百分点的平均分布误差。在回答形式的对比中,相较于强制选择回答,概率诱导方式将误差减少了 19.72 个点(已记录的 bootstrap 估计值)。

该研究将问卷验证证据扩展到了单一题型之外。它同时阐明了为什么最终拟合度评分必须配备相匹配的基准线。

评估所用问卷

本次对比使用了 300 名匹配的 CES 受访者以及 27 道保留题目:包含 15 道序数题、10 道二元题和两组多选题题组。受访者前序信息提供了上下文,而用于评估的答案则始终未参与生成过程。

四种实验条件分别为:通用强制选择、通用概率或边际概率、人口统计特征概率,以及完整画像概率。多选选项需要边际概率,因为受访者可能会选择多个选项。其解释方式与单选概率向量不同。

实测分布

平均题目绝对误差

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • 通用强制选择26.927
  • 通用概率或边际概率7.036
  • 人口统计特征概率4.563
  • 完整画像概率4.720
0百分点 · 越低越好30
实验条件平均题目绝对误差
通用强制选择26.927 pp
通用概率或边际概率7.036 pp
人口统计特征概率4.563 pp
完整画像概率4.720 pp

拟合度等于 100 减去平均绝对百分点误差。因此,95.28% 这一数字反映的是这些受评题目上的平均分布拟合程度,而非被精确模拟的人群百分比。

经记录的 bootstrap 概率提升为 19.719 个点,四舍五入为 19.72。报告的点估计对比为 19.892 个点,95% 置信区间为 16.257 至 23.401。Bootstrap 汇总与所展示的条件均值采用了不同的汇总方法和取整规则,二者不可在未经说明的情况下互相替代。

更丰富画像带来的改善与局限

完整画像相较于通用概率提示有所改善,但在主要总体指标上并未优于相匹配的人口统计特征概率。画像对比人口统计特征的提升为 -0.157 个点,且其区间跨越了零点。

画像上下文提升了个体层面的准确率,但总体误差略逊于仅有人口统计特征的情况。因此,这一结果具有两面性:它证实了回答形式具有显著影响,但并未确认完整画像条件相较于人口统计特征条件具有总体优势。

研究中仅包含两组多选题目。这是来自混合问卷的具体证据,并不代表在不同领域和调查工具中多选题校准的普遍有效性。

证据的实际应用

在进行分布估计时,数据收集与聚合机制应作为研究设计的显性组成部分。当更丰富的受众被允许输出概率时,强制分类基准并不能有效隔离出画像本身的实际价值。

对比研究还应明确其目标是题目层面的总体拟合还是个体层面的预测。更丰富的上下文并不意味着两者都会自然提升。受测样本、模型配置和问卷本身界定了结论的适用边界。

这种在隔离测试框架下的实验,不能保证当前的产品行为,也不能保证对新客户受众具有代表性的估计。即使在运行时进行了目标隔离,预训练阶段接触公开来源数据的可能性依然存在。

ANES 纵向研究考察了相同的总体与个体区分。PISA 对比研究补充了涵盖五个国家的环境。证据概览串联了这些结果,而未将其简单合并为一个评分。

参考数据

CES 2024