为什么通用 AI 的创意趋于雷同,而角色设定不会
在创意多样性评分中(总分 10 分),基于角色设定的智能体获得 7.90 分,而统一基线智能体仅为 3.14 分,人类专家为 8.90 分。
通用 AI 系统往往会重复输出同样精致的回答:相似的结构、相似的语言以及相似的假设。而 Spark Effect 研究测试了赋予 AI 丰富且具体的角色设定(personas)是否能激发真正多元的创意。
实验结果非常显著。在创意多样性评分中,基于角色设定的智能体平均得分高达 7.90 分(总分 10 分),而统一的单智能体基线仅为 3.14 分。人类专家的平均得分则为 8.90 分。
结果一览
平均创意多样性评分
本研究报告的结果。下方表格和讨论保留了研究范围、对照基线与不确定性。
- 基于角色设定的 Spark 智能体7.90
- 统一的单智能体基线3.14
- 人类专家对照组8.90
| 最终指标 | 结果 | 衡量维度 |
|---|---|---|
| 基于角色设定的 Spark 智能体 | 7.90/10 | 平均创意多样性评分 |
| 统一的单智能体基线 | 3.14/10 | 无丰富角色设定下的平均评分 |
| 人类专家对照组 | 8.90/10 | 专家撰写作品的平均评分 |
| 配对 Spark 优势 | +5.69 分 | 七项配对任务中的平均优势 |
| 标准化效应量 | d = 2.88 | Spark 与统一基线之间的差异幅度 |
在七项配对创意任务中,Spark 智能体相比统一基线的平均优势达到 5.69 分,标准化效应量(Cohen's d)高达 2.88。
已发表的论文还指出,从早期的前 Spark 专业化智能体阶段到最终的 Spark 系统,表现提升了 4.1 分。这是不同的对比维度,不应混为一谈。
改变了什么?
基线系统使用的是没有丰富角色设定的单一智能体。而 Spark 系统则使用了具有独特身份、动机、风格、优先级和明确界限的多个智能体。
该方法没有向同一个通用助手的多个副本索取创意,而是刻意组建了一个多元化的团队。其中一个智能体可能专注于可衡量的商业价值,另一个专注于可持续发展,还有一个专注于文化内涵,甚至还有一个专门提出令人不适的反驳观点。
这样做的目的并非为了戏剧性的角色扮演,而是为了减少创意的趋同。
如何衡量多样性?
该研究对比了真实创意任务中多种实验条件下的输出结果。大语言模型(LLM)评估器根据评估人类标注参考作品的相同标准,对每个结果的多样性进行了评分。
各条件下的平均得分如下:
- 统一的单智能体基线:3.14
- 早期的专业化智能体:3.76
- 最终基于角色设定的 Spark 智能体:7.90
- 人类专家对照组:8.90
评估器对人类作品的评分高于人类自身的原始评分,这表明存在 1.32 分的乐观偏差。由于这种偏差的存在,最合理的解释应当是不同条件之间的相对差异,而非断言机器评分是衡量创造力的绝对客观标准。
哪些方面变得更加多样化?
这种提升主要体现在三个实际领域。
首先,智能体提出了更广泛的策略,而不是重复单一的共识建议。其次,不同的角色设定揭示了伦理、环境和文化层面的冲突,而这些往往是统一基线所忽略的。第三,语气和框架的变化更加自然,为创意团队提供了真正的替代方案,而不是同一个答案的十个不同版本。
为什么这对 Minds 至关重要
Minds 采用了相同的核心原则:单个合成受访者不应退化为同一种通用的声音。独特的画像、知识背景、动机和约束条件,能够帮助样本组产生分歧和不同的推理路径。
对于研究团队而言,多样性并不等同于准确性,但它是重要的前提。如果样本组的每个成员都像同一个热心的助手那样回答问题,那么它就无法代表多元化的受众。
这项研究表明了什么
该研究提供了证据,表明相较于统一的智能体设置,角色设定可以实质性地提高创意多样性。它还表明,设计合理的精心多智能体系统可以显著拉近与人类专家作品多样性之间的差距。
这项研究没有表明什么
该基准测试仅涵盖了有限的创意任务,且使用的是单一模型系列。评分依赖于具有明显乐观偏差的 LLM 裁判。因此,该研究并不能证明每种角色设定都能改善所有任务,也不能证明 Spark 的输出等同于人类的创造力。
此外,它测试的是创意多样性,而非消费者调查的准确性。如需了解外部有效性证据,请阅读《我们针对现实测试了合成受众》和《我们通过允许 Minds 保持不确定性将调查误差减半》。
来源
阅读 arXiv 预印本全文:The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems。
常见问题
Spark 智能体的多样性提高了多少?
Spark 智能体平均得分为 7.90 分(总分 10 分),而统一智能体仅为 3.14 分。在七项配对任务中,其平均优势达到 5.69 分。
Spark 智能体的表现超过人类专家了吗?
没有。人类专家平均得分为 8.90 分,比 Spark 智能体的 7.90 分高出 1 分。
该研究是否经过同行评审?
该研究目前作为 arXiv 预印本公开,尚未通过同行评审。


