·Methodology·Minds Team

如何解读合成受众准确性声明

九个合成受众供应商发布了准确性数据。他们使用不同的指标、不同的基准和不同的样本,因此这些数字无法相互排名。八个问题将可验证的声明与不可证伪的声明区分开来。

合成研究供应商发布的准确性数据在85%到98%之间。快速阅读时,这个领域看起来已经稳定,差异似乎很小。

但它们是不可比较的。这些百分比测量的是不同的量,基于不同的基准和不同的任务,其中一些根本不测量准确性。本文阐述了我们在2026年9月阅读九个供应商(包括我们自己)发布的材料时发现的内容,以及将可验证的声明与不可验证的声明区分开的八个问题。

我们在这里有一个利益关系。Minds销售合成受众。因此,下面的标准同样适用于我们,而我们表现最差的地方也如同其他人一样明确说明。

八个问题

一个发布的准确性声明在回答以下问题时是可验证的:

  1. 对什么外部标准? 一个命名的、独立的数据集或已发布的研究,而不是内部样本。
  2. 对什么上限? 人类并不能完美地再现自己的答案。他们的自我一致性是现实的最大值。
  3. 对什么下限? 在没有模型支持的情况下,同一指标的得分。
  4. 该指标意味着什么? “准确性”并不是自我定义的。
  5. 与什么基准比较? 对同一模型的简单提示是重要的比较,因为那是免费的替代方案。
  6. 由谁审查? 同行评审或预印本邀请修正。
  7. 在哪里失败? 没有发布失败模式的方法没有经过足够严格的测试以发现问题。
  8. 任何人都能检查吗? 方法、样本和数据可供检查。

该领域发布的内容

根据供应商自己的公共页面和论文汇编,2026年9月。

供应商头条数字测量内容
Simile85%的人类自我重测可靠性源个体答案的再现,与人类噪声下限相比
Artificial Societies86%的分布准确性分布匹配,与声明的91%人类上限相比
Articos86%的专家识别主题主题恢复与已发布的专家报告相比
Evelance89.78%的主题重叠主题匹配,7个角色与23个真实用户
Synthetic Users85–92%的“合成有机平衡”合成与真实访谈的相似性
Aaru0.90的中位相关性在一个客户研究中的相关性
Evidenza88%的准确性,0.81的相关性指标未公开定义
Fairgen98%的合理性通过率内部质量门,而非准确性
MindsSpearman 0.85,+4%的规模偏差在54个广告与人类小组的排名相关性

接下来有两个观察,且都与哪个产品更好无关。

最高的数字并不是准确性数字。 Fairgen的98%是通过他们自己的六维质量门的生成档案的份额。它并没有说明输出是否与人类数据匹配,Fairgen也没有声称它匹配。任何按百分比对这个表进行排序的人都会在一个他们从未参与的测量上将其排在第一位。

只有两个数字是可比的。 Simile的85%和Artificial Societies的86%都表示为人类自身所达到的份额。它们可以进行比较。该列中的其他内容无法与任何内容进行比较,包括彼此。

谁发布失败

这是该领域最明显的分界线。

Fairgen声明了他们的方法不适合的研究:品牌跟踪、细分、联合。它们的指导是“在进入实地之前进行压力测试,而不是替代”。Synthetic Users声明合成受访者“在没有校准的情况下是个体上可信的,但整体上是错误的”。Articos和Evelance都表示他们的输出是方向性的,应该与人类研究并行,而不是替代它。

Aaru、Evidenza和Artificial Societies没有发布我们能找到的失败条件。

我们的立场,包括差距

我们自己的研究使用四条件消融,保留真实答案,在目标开放之前封存候选选择,并在结果旁边报告机会下限。在一个GSS项目集中,平坦分布在没有模型支持的情况下已经得分83.71%;我们的92.47%关闭了剩余距离的54%。下限应与百分比并列,而通常缺失。

我们发布了未成功的结果。注册的档案提升为0.17分,其95%区间为-1.00到+1.31,跨越零,并未达到其推广标准。在盲测比较中的短期日常提示中,我们的受众以13.8%获胜,而通用提示为30.5%,人口统计提示为34.0%。这是一场失败,并已发布。

我们没有的是同行评审。 Simile的微调结果在2025年EMNLP上出现,公开数据集包含290万条响应。Artificial Societies在《英国心理学杂志》(British Journal of Psychology)上有一个群体行为结果。我们没有。我们的验证工作发布在我们自己的网站上,并未经过外部审查,直到它经过审查,读者有理由以不同的方式看待它。

我们与SINUS-Institut的合作有时被视为验证。其实不是。这是来源:我们角色所基于的环境模型来自他们数十年的研究,这是关于输入而非准确性的声明。他们的董事总经理明确表示,Milieu-Minds“既不替代社会研究,也不替代我们研究所的专业知识”。

如何在十分钟内检查任何供应商

询问指标的定义、样本大小、基准和失败条件。询问在没有模型支持的情况下同一测量的得分。如果供应商无法提供这些,百分比就是市场营销,无论是谁发布的,无论看起来多么有利。

这个测试对我们来说也不舒服。它只是唯一能告诉买家任何信息的测试。

来源

以上所有数据均取自各供应商自己的公开材料,检索日期为 2026 年 9 月 22 日。声明会变化;在依赖之前请核对来源。如果我们误读了您的材料,请告知我们,我们会更正。

常见问题

合成受众的准确性如何?

没有一个单一的数字。发布的数字范围从85%到98%,但它们测量的是不同的内容:主题重叠、分布匹配、响应一致性、质量门通过率和排名相关性是不可互换的。准确性数字只有在与其指标、基准和测量任务一起考虑时才有意义。

为什么我不能比较两个供应商的准确性百分比?

因为分母不同。一个供应商可能报告从专家报告中恢复的主题份额,另一个报告匹配的响应分布份额,另一个报告通过内部质量门的生成档案比例。将这些数字相互排名会产生毫无意义的排序。

什么是人类上限,为什么它重要?

人类并不能完美地再现自己的调查答案。两周后再次询问,他们的答案会与自己不同。这个自我一致性率是任何模拟的现实上限,因此将结果报告为其份额比报告原始百分比更具信息性。

什么是机会下限?

一种方法在没有模型和数据支持的情况下所达到的分数。在我们的一个GSS项目集中,平坦分布的得分已经是83.71%。因此,报告的92.47%关闭了该下限与完美分数之间54%的距离,这与“92%准确”是非常不同的声明。