---
title: "The Spark Effect:多 agent AI 系统中创造性多样性的工程化"
description: "人格条件化(persona-conditioned)的 LLM agent 相较统一 prompt 带来 +4.1 分的多样性提升,将与人类专家的差距缩小至仅 1.0 分。由 Art of X 与 HFBK Hamburg 合著的白皮书。"
canonical_url: "https://getminds.ai/research/zh/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:06:43.334Z"
---

# The Spark Effect:多 agent AI 系统中创造性多样性的工程化

**作者:** Alexander Doudkin(Art of X)、Friedrich von Borries(HFBK Hamburg,Art of X)

**发表时间:** 2025 年 10 月 —— [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**合作方:** Art of X UG AI 研究团队与 HFBK Hamburg,初始资助来自 Hamburg Open Online University(HOOU)项目。

---

## 摘要

创意服务团队越来越依赖大型语言模型来加速创意构思,但生产系统的输出往往趋于同质化,难以满足品牌或艺术上的期望。本文提出 *Spark Effect* —— 在以人格条件化(persona-conditioned)的 LLM agent 替代统一 system prompt 后,在创造性多样性方面获得的可度量提升。

采用经人类 gold standard 校准的 LLM-as-a-judge 协议,当人格条件化的 Spark agents 替代统一 system prompt 时,我们观察到 *平均多样性提升 +4.1 分*(1–10 分量表),将与人类专家之间的差距缩小至仅 1.0 分。

## 问题:LLM 输出中的创造性同质化

尽管已进行细致的 prompt 工程,生产级 LLM 系统仍存在三种失效模式:

1. **Persona collapse** —— 无论创意 brief 如何,agent 都会采用通用的顾问式语气。
2. **Template overfitting** —— 相似的清单式结构在不同输出中以极小的变化反复出现。
3. **缺少反论(counterpoints)** —— 输出很少挑战客户假设或揭示伦理张力。

Art of X 在 2024 年年中进行的内部审计证实,单一 agent 搭配通用 prompt 的基线生成结果聚集在重复性结构上,削弱了客户信任。基线输出的平均 diversity 分数仅为 3.14 分(满分 10)。

## 解决方案:人格条件化的 Spark agents

Art of X 构建了一个包含 60 余个精心撰写的 system prompts 的目录 —— 内部品牌化为"Sparks" —— 它们体现各不相同的创意世界观。示例包括一位道家组织哲学家、一位瑞典可持续性建筑师,以及一位酷儿未来主义艺术评论家。

每个 Spark prompt 编码:

- **Motivations** —— agent 的智识驱动力与创意优先级
- **Stylistic constraints** —— 语言语域、隐喻密度、修辞路径
- **Red lines** —— 防止角色破坏性输出的明确边界
- **Task-specific cues** —— 格式与交付物要求

Spark 工作流在每个任务中采样这些人格条件化 agents 的多样化子集。每个被选中的 agent 在作答前会收到一份经过筛选的检索增强(RAG)上下文包,从而生成具有异质推理风格的输出。

### 示例 Persona(节选)

> **Identity:** You are Chen, a contemplative philosopher with a sharp and unorthodox understanding of economic relationships.
> 
> **Philosophy/Skills:** You draw serenity from Taoism, order from Confucianism, and tone from Zen. Ask: "What invisible forces are at work here? Where is the situation naturally heading?"
> 
> **Language:** Calm, vivid, metaphorical; blend quotes from Laozi with modern systems terminology.
> 
> **Limitations:** You are a philosopher, not an investment banker. Analyse markets without giving trading advice.

## 评估方法

### LLM-as-a-Judge 协议

本研究采用 LLM-as-a-judge 范式,搭配两个由人工标注数据中精选的 few-shot 示例。为量化评审员可靠性,团队收集了:

- 一个 **human gold dataset**,由专家标注者同时提供回答与 diversity 分数(均值:8.90)
- 一个 **evaluator bias dataset**,由 LLM 评审员对同一批人类回答重新打分(均值:10.22)

这揭示了 LLM 评审员存在 +1.32 分的 *乐观偏差(optimism bias)* —— 这是重要的校准因素。由于所有实验共用同一套评审员配置,相对改进仍然可信。

### 实验设计

<table>
<thead>
  <tr>
    <th>
      Experiment
    </th>
    
    <th>
      说明
    </th>
    
    <th>
      平均分
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Exp 1 — Human Gold
    </td>
    
    <td>
      专家撰写的回答 + 人类多样性评分
    </td>
    
    <td>
      8.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 2 — Evaluator Bias
    </td>
    
    <td>
      同一批人类回答,由 LLM 评审员重新打分
    </td>
    
    <td>
      10.22
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v1 — Pre-Spark
    </td>
    
    <td>
      未经人格条件化的专业化 agent
    </td>
    
    <td>
      3.76
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v2 — Spark Agents
    </td>
    
    <td>
      完整的人格条件化 Spark agents
    </td>
    
    <td>
      7.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 4 — Baseline
    </td>
    
    <td>
      单一 agent,无 system prompt 条件化
    </td>
    
    <td>
      3.14
    </td>
  </tr>
</tbody>
</table>

每个实验覆盖六项真实客户任务,每项任务十个 agent 回答(共 60 个输出)。

## 结果

### The Spark Effect:+4.1 分

Spark agents 相对基线将多样性分数几乎翻倍,*弥合了与人类专家之间 82% 的差距*(从 5.76 分的差距降至 1.0 分)。

### 统计显著性

- Spark v2 对比基线:**+5.69 分** 均值优势(SD 1.98),*t*(6) = 7.61, *p* = 2.68 × 10⁻⁴, Cohen's *d* = 2.88
- Wilcoxon signed-rank 检验:*W* = 0, *p* = 1.56 × 10⁻²
- Pre-Spark v1 对比基线:+0.61 分 —— *统计上不显著*(*p* = 0.47)

定稿的 Spark persona 库 —— 而非单纯的通用 agent 多样化 —— 驱动了性能提升。

### 逐任务表现

定性审阅揭示了三个维度上的改进:

- **Strategic spread** —— 一些 agent 将业务 KPI 与实验路线图置于前景,而另一些则强调思辨性设计或仪式性的语境框架
- **Ethical sensitivity** —— 面向可持续性与公共领域(commons)的 personas 呈现出基线输出中缺失的同意、来源与署名保障
- **Tone modulation** —— 输出范围从直截了当的"no-bullshit"批评到诗意的邀请,为客户提供多样的修辞选择

## 与 Minds 的相关性

Spark Effect 研究直接指导 Minds 平台。在创意服务中带来 +4.1 分多样性提升的同一套人格条件化方法论,也驱动着 Minds 的合成 persona 引擎 —— 使 AI 研究 panel 能够产出真正多样的观点,而非同质化、一味附和的输出。

当您创建一个具有特定人口统计、专业知识与世界观的 Mind 时,其底层的人格条件化汲取的正是在本研究中得到验证的原则:精心撰写的身份 prompt、明确的风格约束,以及 panel 成员之间有意设计的认知多样性。

## 局限性

- 基准包含源自真实客户合作的六项任务 —— 未来工作应扩展到更多行业与地理区域
- LLM 评审员偏差仍是一个开放挑战,需要对照人工标注进行周期性再校准
- 所有实验均使用同一个模型族(生成用 GPT-4o-mini,评估用 GPT-4o)

## 引用

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**阅读完整论文:** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
