·Validation·Minds Team

留出样本访谈:受访者记忆何时发挥作用

基于两个公开访谈语料库,测试精简画像与检索到的早期证据能否提升对 22 名真实受访者后续 66 个回答的保真度。

在针对 22 名受访者及 66 个留出访谈回答的验证中,包含相关检索证据的精简画像相较于通用提示词提升了受访者契合度得分。经注册的受访者聚类提升幅度达 24.37 个综合分,且在两个评估语料库中均表现出正向的平均优势。

核心探讨的问题非常明确:一个有实据依托的合成受访者,能否更精准地反映某位具体受访者在后续访谈中的真实表述,而不仅仅是针对访谈问题给出一个看似合理的回答?

前期证据与后续回答

本研究采用了两个公开访谈语料库,分别涉及激光牙科从业者与难民粮食短缺问题。前期的访谈内容用于构建受访者的精简画像及可检索证据。每位受访者后续的 3 个回答被保留作为评估基准。

在同模型条件下,研究对比了通用提示词、角色背景(role context)、画像背景(profile context)以及画像加检索(profile plus retrieval)四种设置。这些对比有助于将宽泛角色描述的价值与受访者专属证据的价值区分开来。

研究共包含 66 个目标回答,但仅来自 22 名受访者。由于来自同一受访者的多个回答属于相关观测值,因此在计算不确定性时必须将受访者视为聚类单元。

观测到的保真度优势

综合结果

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • 精简画像加检索,均值60.33
  • 通用提示词,均值35.98
0得分 / 100100
条件或对比维度综合结果
精简画像加检索,均值60.33
通用提示词,均值35.98
相比通用提示词的注册提升+24.37 分
相比角色背景的注册提升+18.58 分
相比纯画像背景的注册提升+6.10 分

经注册的受访者聚类对比结果并非四舍五入后的描述性均值之差。综合分反映的是评估模型打分的回答保真度,它不是近似百分比,不是问卷分布准确率,也不是被正确模拟的个体占比。

相较于通用提示词的正向优势在两个语料库以及第二种评估模型版本下均有体现。这表明相关前期证据对预测后续访谈回答具有实际价值,但该效应在全新领域的具体强度仍有待进一步验证。

为什么检索在此处至关重要

精简画像记录了受访者的稳定背景特征,但后续的问题可能需要特定的早期经历或论据支持。检索机制能够将相关证据按需调入回答生成过程,而无需让记录中的每一个细节都干扰每一个回答。

评估结果与这一解释相吻合。但这并不意味着记忆容量越大越好,也无法证明某一种检索技术具有普适效果。本次结论严格受限于所评估的工作流、允许输入的上下文范围以及所保留的留出问题。

局限性与基础模型后续评估

本研究的证据样本规模较小,仅涵盖两个语料库。部分原始访谈内容经过英译,这增加了对语调风格及精确用词进行判断的难度。评分由自动化模型裁判完成,而非独立的人工评估员,因此不应被视为经人工核验的保真度。

知名基础模型对比研究基于相同的 22 名受访者和 66 个回答,采用了不同的候选模型集合与评分对比基准。该研究属于基于同一证据集的后续评估,而非独立的群体复现实验。其综合得分不应与本研究的得分合并计算。

PRISM Alignment 对比评估提供了另一套独立的受访者契合度数据集与不同的任务边界。证据总览则阐明了这些定性分析结果如何对问卷分布证据形成补充,而非取而代之。

紧凑画像近似模拟了生产环境中的训练与检索流程,并未精确复现该流程。

参考数据

De-identified, English Transcripts of 36 interviews

Transcription Data

CC BY 4.0