·Validation·Minds Team

人工智能能否重现真实的 Z 世代食品调查?Minds 达到 93.99% 的近似度

在三个用餐频率问题 and 21 个回答选项单元格中,Minds 的平均误差为 6.01 个百分点,达到了 78.98% 的分布重合度,并完成了所有计划的回答。

一项真实的英国调查询问了年轻人早餐、午餐和晚餐外出就餐或购买外卖的频率。这项结果盲态验证向 301 个锁定的 Z 世代 Minds 组成的受众提出了相同的问题,并将综合回答分布与已发布的真实人类结果进行了对比。

主要结果是对真实调查分布的综合近似度达到 93.99%。在 21 个回答选项单元格中,平均差距为 6.01 个百分点。所有 903 个计划的 Mind 问题回答均成功完成。

本分析评估的是综合分布的一致性。它不将该得分视为个体预测准确率,也不将其视为相同性能适用于所有受众和问题类型的证据。

结果一览

验证结果数值含义
对真实调查的近似度93.99%100% 减去 21 个回答选项单元格的平均百分点差距
与真实调查的平均差距6.01 ppMinds 与真实调查百分比之间的平均绝对差值
平均分布重合度78.98%每个完整回答分布的重合比例
已完成的回答903 / 903所有 301 个 Minds 回答了全部三个问题
皮尔逊相关系数0.80421 个真实百分比与合成百分比之间的高度一致性
斯皮尔曼相关系数0.834回答选项排序方式的高度一致性

研究问题与参考数据

用餐频率取决于日常生活习惯、工作或学习、预算、便利性、社交背景以及本地供应情况。因此,它提供了一个实际的测试,以验证合成受众是否能够重现完整的消费者回答分布,而不仅仅是产生看似合理的定性评论。

参考数据来自英国 Food Standards Agency 的 Food and You 2, Wave 10 研究。实地调查于 2024 年 10 月 9 日至 2025 年 2 月 7 日进行,公开数据集于 2025 年 9 月 25 日发布。本分析使用了针对 16 至 24 岁人群的已发布结果,每个评估项目的真实人类样本基数为 257。

三个注册的问题为:

  • 您早餐外出就餐或购买外卖的频率如何?
  • 您午餐外出就餐或购买外卖的频率如何?
  • 您晚餐外出就餐或购买外卖的频率如何?

每个问题有七个注册的回答选项。因此,验证性分析对比了 21 个合成百分比与人类百分比。

受众:301 个持续存在的 Z 世代 Minds

合成样本组代表了英格兰、威尔士和北爱尔兰 16 至 24 岁的年轻人。锁定的群体在年龄、性别、国家/地区、收入、日常生活习惯和社交背景方面具有多样性。所有 301 个 Minds 均在检查当前结果之前选定。

样本构成

年龄段
  • 1
    16–1829%
  • 2
    19–2137%
  • 3
    22–2434%
性别
  • 1
    女性65%
  • 2
    男性35%
国家/地区
  • 1
    英格兰84%
  • 2
    威尔士8%
  • 3
    北爱尔兰8%
Food and You 2 Survey: Wave 10 dataset
Food and You 2: Wave 10 research report

这些是持续存在的受众成员,而不是为单个问题临时生成的角色。该样本组基于由 14,671 个检索分块表示的 20,500 个知识项,从而允许在不同的研究任务中重复使用相同的合成群体。

研究设计与评估指标

本研究采用了预先注册的同群体复制设计:

  1. 锁定 301 人的合成受众。
  2. 使用原始回答选项提出原始调查问题。
  3. 在 Minds 运行时中排除真实的调查百分比。
  4. 将所有 903 个 Mind 回答汇总为三个完整的分布。
  5. 将每个合成回答选项百分比与已发布的真实人类结果进行对比。

Minds 并没有将不确定性强加于单一的硬性投票中,而是展示了每个受众成员选择每个可用回答的概率。然后将这些概率合并为最终的样本组分布。

设计要素注册规范
合成样本301 个 16-24 岁的持续存在 Minds
人类参考已发布的 Food and You 2 青年群体分布;每个问题基数 n=257
工具3 个用餐频率问题 × 7 个选项
计划回答903 个 Mind 问题回答
主要终点21 个单元格的未加权平均绝对百分点误差
次要终点分布重合度、詹森-香农散度、皮尔逊相关系数和斯皮尔曼相关系数
结果隔离运行时扣留人类百分比和基准文件

百分比近似度定义为 100% − 平均绝对百分点误差。平均分布重合度为三个问题的平均 1 − 总变差距离。詹森-香农散度以比特为单位衡量分布形状的差异,其中零表示完全相同的分布。

每个问题的得分均在 91 以上

与真实情况的平均差距

本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。

  • 早餐频率2.98
  • 午餐频率6.48
  • 晚餐频率8.56
0百分点 · 越低越好10
问题对真实调查的近似度与真实情况的平均差距
早餐频率97.02%2.98 pp
午餐频率93.52%6.48 pp
晚餐频率91.44%8.56 pp
所有 21 个回答选项单元格93.99%6.01 pp

早餐的单元格级误差最低,而晚餐最高。综合结果并非仅由单个问题驱动:每个问题对其真实调查分布的近似度均达到了 91% 以上。

次要分布检查

由于仅凭平均绝对误差无法完整描述分布形状,本分析包含了四项补充检查。

  • 78.98% 的平均分布重合度: 大部分回答权重出现在真实结果和合成结果的相同位置。
  • 0.0602 詹森-香农散度: 整体形状接近;零表示完全相同的分布。
  • 0.804 皮尔逊相关系数: 较大和较小的百分比往往呈现同步变动趋势。
  • 0.834 斯皮尔曼相关系数: 回答选项按流行程度的排序相似。

所有四项指标都指向同一个方向:在此评估工具中,Minds 分布在绝对水平和相对形状上都接近人类参考数据。相关系数作为辅助衡量指标报告,并不取代水平误差指标。

回答完整性与知识基底

903 个被采纳的回答中,每一个都带有出处追溯:

  • 889 个回答 使用了检索到的 Mind 知识;
  • 14 个回答 使用了 Mind 的固有画像;
  • 0 个回答 被标记为无支持;且
  • 301 个 Minds 中的 301 个 完成了每个问题。

这些出处字段证实了本次运行使用的是持续存在的 Mind 路径,而非无支持的回答。它们本身并不能证明每个检索到的记忆对最终分布都具有因果必要性。

实际应用解读

在测试范围内,该结果支持将基于知识基底的合成样本组用于快速、迭代的研究,例如:

  • 在媒体投放前测试营销活动主张;
  • 对比产品或包装概念;
  • 探索不同受众群体反应差异的原因;
  • 在实地调查前完善调查问题;以及
  • 为后续的人类验证确定最强有力的方向。

该结果支持快速的方向性和对比性工作。高风险的主张、受监管的决策、精确的市场规模测算以及验证范围之外的问题,可能仍需要招募受访者并进行合适的人类研究设计。

范围与局限性

这是一项使用公开 Food and You 2 数据的独立 Minds 验证。Food Standards Agency 制作了参考调查,但并未资助、认可或审查本 Minds 研究。

本研究支持本研究未确立
在三个英国青年用餐频率分布上高度的综合一致性93.99% 的个体级预测准确率
301 个 Minds 和 903 个回答的完整生产执行跨受众、国家、领域或问题类型的通用性能
MAE、重合度、散度和相关性指标之间的一致性仅靠知识基底产生所观察到的一致性的因果证明
运行时的结果隔离完全排除通过预训练或持续知识库间接接触公开调查的可能性

这是一项同群体、同工具的复制研究,涵盖了来自同一项调查的三个密切相关的问题。人类受访者与合成受众并未进行个体一一匹配,且本分析对比的是综合分布。对于这一公开结果,未从人类微观数据中估算抽样不确定性区间。在提出更广泛的准确性主张之前,需要在不相交的受众和工具上进行进一步的验证。

来源

常见问题

Minds 与真实的 Food and You 调查匹配程度如何?

在 21 个回答选项百分比中,Minds 对真实调查的综合近似度达到了 93.99%。平均差距为 6.01 个百分点,平均分布重合度为 78.98%。

93.99% 的近似度是否意味着 Minds 正确预测了每个个体?

不。93.99% 的近似度计算方式为 100% 减去 21 个综合调查单元格的平均百分点差距。它衡量的是受众分布与真实调查的匹配紧密程度,而不是是否正确预测了每个个体的回答。

这些是真实的受访者吗?

不是。他们是 301 个持续存在的、年龄在 16 至 24 岁之间的合成受众成员。他们的综合回答与英国 Food Standards Agency 真实调查的已发布结果进行了对比。

真实的调查结果是否展示给了 Minds?

没有。问题和回答选项被重现,但基准数据集和真实百分比在运行时被排除在外。由于数据源是公开的,无法完全排除通过模型预训练或持续知识库产生的间接接触。

这与向通用人工智能进行 301 次提示有何不同?

Minds 是持续存在的受众成员,基于 20,500 个知识项和 14,671 个检索分块。在本次运行中,903 个回答中有 889 个使用了检索到的 Mind 知识,14 个使用了固有画像,且没有一个回答是无支持的。