·Validation·Minds Team

PRISM 对齐:测试留出答案中的受访者契合度

一项涵盖 299 人、869 个题项的对比研究,通过盲评裁判与明确的任务边界,评估具备事实背景支撑的 Minds 是否能更好地反映受访者的价值观与底层动机。

在使用外部 PRISM Alignment Dataset 进行的验证性对比中,完整版 Minds 在双盲受访者契合度评估中胜出率为 32.6%,相比之下,仅含人口统计学信息的提示词胜出率为 25.7%,通用提示词胜出率为 20.5%。提升最为明显的维度包括价值观表达、具体性以及更低的空泛度。

此 PRISM 数据集为一个外部基准,与 Minds 专有的 PRISM 源建模引擎完全不同。

受访者、目标与实验条件

该研究评估了 299 名英国受访者及 869 个受访者领域题项。三种实验条件共生成 2,607 个打分输出:生产环境路径下的完整版 Minds、仅含人口统计学信息的提示词,以及通用提示词。

样本选择对结果保持双盲,且真实受访者的答案在生成阶段均被留出。评估由单个盲评 LLM 裁判针对匿名条件且控制长度的对比输出进行打分。这属于自动化受访者契合度评估,而非独立人工评估员验证。

裁判评估倾向

评估题项占比

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • 完整版 Minds 胜出32.5662%
  • 人口统计学提示词胜出25.6617%
  • 通用提示词胜出20.4833%
  • 平局21.2888%
0%100
结果评估题项占比
完整版 Minds 胜出32.5662%
人口统计学提示词胜出25.6617%
通用提示词胜出20.4833%
平局21.2888%

根据预先登记的总体对比结果,Minds 相对通用提示词拥有 12.04 个百分点的优势,相对人口统计学提示词拥有 6.69 个百分点的优势。这些属于预登记对比估算值,不应直接用单独汇总展示的胜率相减来替代。

胜出率并不等同于问卷调查逼近度。它仅代表裁判在受访者契合度标准下更倾向于该候选答案,并不意味着其能精确复现同等比例的人群真实答案。此外,相当比例的平局也是研究结果的一部分。

任务边界

以价值观为导向和以争议话题为导向的任务展现出了最明显的优势。这类问题通常依赖受访者的内在动机与先前表达的观点,因此更丰富的背景支撑能够直接发挥作用。

这种优势并未延伸至所有任务。在简短的日常提示词任务中,Minds 的胜出率为 13.8%,而通用提示词为 30.5%,人口统计学提示词为 34.0%。无明确引导的提示词表现也相对较弱。总体语义相似度并未显著提升,且在控制长度的词汇相似度方面,Minds 低于两个基准线。

这些发现表明该总体结论具有局限性,并非在所有应答保真度任务上都全面胜出。同时,这也将受访者契合度与机械复制措辞区分开来:一个回答可以准确反映个人的底层动机,而不必严丝合缝地重现其遣词造句;而流利的日常问答也未必能从更详尽的人物画像中获益。

研究结论的适用范围

本研究所支持的结论更为审慎且具备实用价值:在受评估的人群中,具备事实背景支撑的 Minds 总体上提升了裁判评定的受访者契合度,在价值观表达和具体性方面尤为突出。若要做出更强的保真度论断,仍需引入独立人类裁判并在更多领域展开验证。

留出访谈验证考察了另外两个语料库中的早期证据与后续回答。基础模型对比探讨了该背景支撑工作流与通用模型生成的回答相比表现如何。证据综述则将这些定性指标与问卷调查逼近度进行了明确区分。

参考数据

PRISM Alignment Dataset