ANES 2024:合成回答与后续人类回答的对比研究
一项基于 ANES 选前/选后数据的对比测试,针对 300 名匹配受访者的 28 项后续回答展开评估,分别呈现响应格式与受访者背景锚定的不同结果。
Minds Research Lab 关于合成受访者、人物角色条件化 AI、评估方法以及模拟证据边界的实验、基准与技术论文。
一项基于 ANES 选前/选后数据的对比测试,针对 300 名匹配受访者的 28 项后续回答展开评估,分别呈现响应格式与受访者背景锚定的不同结果。
一项 CES 对比研究对 300 名匹配受访者在 27 道二元题、序数题及多选题上的表现进行了评估,区分了总体拟合度与个体预测。
一项目标隔离的 GSS 试点研究,在 360 名受访者和 17 道问题中对比了四种回答条件,将概率引出与画像价值分别进行了评估。
基于两个公开访谈语料库,测试精简画像与检索到的早期证据能否提升对 22 名真实受访者后续 66 个回答的保真度。
一项涵盖五国的 PISA 对比研究评估了 600 名学生及 10 道留出题,呈现加权分布误差,并明确指出了国家与语言层面的局限性。
一项涵盖 299 人、869 个题项的对比研究,通过盲评裁判与明确的任务边界,评估具备事实背景支撑的 Minds 是否能更好地反映受访者的价值观与底层动机。
一项留出访谈对比测试表明,在何种情况下,受访者画像和记忆机制能让合成回答优于通用的 GPT、Claude 和 Gemini 提示词。
一份公开指南,全面梳理 Minds 可用的定性与定量研究方法、所需输入、版本化流水线阶段、计算器、产出物及边界限制。
五个公开调查数据集揭示了合成受众的准确性,包括一项包含 301 个 Mind 的 Z 世代生产环境测试,以及用户画像锚定在何处发挥作用。
一项结果盲态验证将来自 301 个持续存在的 Z 世代 Minds 的 903 份回答与已发布的英国 Food Standards Agency 调查分布进行了对比。综合近似度达到 93.99%。
Minds 用于为合成受众提供依据的公共统计、学术与行业来源,以及 grounding 的使用方式。
Minds 如何将有依据的 AI 画像组成可复用受众,更快探索概念、信息、定位和市场。
一份实用的合成受众验证清单,涵盖受众定义、数据接地、提示词中立性、输出审查、报告撰写以及后续证据。
了解 Minds 如何创建可复用的 AI 角色组、收集并行合成响应,并融入注重证据的研究工作流中。
Spark Effect 研究发现,与统一的单智能体基线相比,基于角色设定的 AI 智能体产出的创意作品多样性显著更高。