PISA 2022:五国合成问卷拟合度评估
一项涵盖五国的 PISA 对比研究评估了 600 名学生及 10 道留出题,呈现加权分布误差,并明确指出了国家与语言层面的局限性。
在采用紧凑画像概率回答的条件下,PISA 2022 对比研究的总体近似度达到 93.80%。在涵盖五个国家 600 名学生的 10 道留出题中,加权平均分布误差为 6.20 个百分点。
这项研究中可复现的积极发现与回答格式有关。相较于通用强制选择,通用概率回答将加权误差降低了 14.86 个百分点,并且在所有评估的国家和问题类别中均表现出正向效果。
跨国对比设计
样本包含来自英国、德国、日本、墨西哥和美国各 120 名学生。10 道题目涵盖五个问题类别。对比的测试条件包括通用强制选择、通用概率、国家及人口统计学概率,以及紧凑画像概率。
测试在所有国家均采用英文母版表述。本研究评估的是国家语境,而非五种本地化语言问卷的答题表现。真实人类评估结果在运行时输入中均被留出隔离。
加权分布结果
加权平均绝对误差
本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。
- 通用强制选择22.29
- 通用概率7.42
- 国家及人口统计学概率6.59
- 紧凑画像概率6.20
| 测试条件 | 加权平均绝对误差 |
|---|---|
| 通用强制选择 | 22.29 pp |
| 通用概率 | 7.42 pp |
| 国家及人口统计学概率 | 6.59 pp |
| 紧凑画像概率 | 6.20 pp |
近似度的计算方式为 100 减去加权平均绝对百分点误差。93.80% 这一结果是由 6.20 个百分点的误差换算而来,并不代表系统准确预测了 93.80% 的具体学生个体。
记录到的加权概率提升为 14.8631 个百分点(四舍五入为 14.86),95% 置信区间为 8.78 至 18.96。该对比仅涉及通用模型条件下的概率采集与强制选择回答之间的差异,绝不能解读为 Minds 画像在此幅度上优于另一款基础模型。
国家覆盖度不等于画像的普适价值
相比于国家及人口统计学特征,紧凑画像仅展现出微弱的描述性优势。记录到的提升为 0.40 个百分点,区间为 -0.53 至 +1.47,总体增量效果尚无定论。
画像测试条件未能通过其国家及问题类别的晋级门槛,且相较于人口统计学条件,个体 Brier 分数和精确匹配率均有所下降。因此,尽管该研究在概率推导方面取得了积极发现,但整体结果喜忧参半。
在解读跨国调研结果时,认清这一边界至关重要。一个理想的加权平均值,并不意味着更丰富的画像必然能改善每个国家或每个问题类别的预测表现。
本项证据的适用范围
该实验表明,当研究目标是评估分布时,在合成回答中保留不确定性是有效的。其在国家层面的一致性表现,进一步证实了回答格式的影响力不仅限于单一国家的数据集。
本研究既不产生经 OECD 官方认可的人口估算,也不验证所有教育议题,更不代表多语言提示工程的准确性。在隔离测试环境中获得的结果,同样不能保证在当前所有产品路径上都能取得完全一致的表现。此外,尽管在运行时隐去了目标数据,但仍无法彻底排除模型预训练期间接触过公开数据的可能。
对客户决策而言,关键依然在于调研工具、目标受众、语言以及评分方式是否与具体应用场景匹配。在将基准测试得分视为预期效果之前,务必先核实这些差异。
CES 问卷对比研究探讨了多种回答形式。Z 世代产品化研究通过真实产品测试了另一类受众。而证据总览则对跨国证据、产品证据以及定性证据进行了清晰的区隔界定。


