---
title: "L'effet Spark : sur l'ingénierie de la diversité créative dans les systèmes d'IA multi-agents"
description: "Les agents LLM persona-conditioned offrent un gain de diversité de +4,1 points par rapport aux prompts uniformes, réduisant l'écart avec les experts humains à seulement 1,0 point. Un livre blanc d'Art of X et de la HFBK Hamburg."
canonical_url: "https://getminds.ai/research/fr/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:06:35.624Z"
---

# L'effet Spark : sur l'ingénierie de la diversité créative dans les systèmes d'IA multi-agents

**Auteurs :** Alexander Doudkin (Art of X), Friedrich von Borries (HFBK Hamburg, Art of X)

**Publié :** octobre 2025 — [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**Collaboration :** équipe AI Research d'Art of X UG et HFBK Hamburg, avec un financement initial du programme Hamburg Open Online University (HOOU).

---

## Résumé

Les équipes de services créatifs s'appuient de plus en plus sur les large language models pour accélérer l'idéation, mais les systèmes en production convergent souvent vers des sorties homogènes qui ne répondent pas aux attentes de marque ou artistiques. Cet article présente l'*effet Spark* — une amélioration mesurable de la creative diversity obtenue en remplaçant les system prompts uniformes par des agents LLM persona-conditioned.

À l'aide d'un protocole LLM-as-a-judge calibré par rapport à des gold standards humains, nous observons un *gain moyen de diversité de +4,1 points* (sur une échelle de 1 à 10) lorsque des agents Spark persona-conditioned remplacent un system prompt uniforme, réduisant l'écart avec les experts humains à seulement 1,0 point.

## Le problème : homogénéité créative dans les sorties LLM

Malgré une ingénierie soignée des prompts, les systèmes LLM en production souffrent de trois modes de défaillance :

1. **Persona collapse** — les agents adoptent un ton générique de consultant indépendamment du brief créatif.
2. **Template overfitting** — des structures de checklist similaires réapparaissent avec peu de variation entre les sorties.
3. **Absence de contrepoints** — les sorties remettent rarement en question les hypothèses du client ni ne font émerger les tensions éthiques.

Un audit interne chez Art of X mi-2024 a confirmé que les générations de référence d'un agent unique avec un prompt générique se regroupaient autour de structures répétitives, affaiblissant la confiance des clients. Le score moyen de diversité pour les sorties de référence n'était que de 3,14 sur 10.

## La solution : agents Spark persona-conditioned

Art of X a développé un catalogue de plus de 60 system prompts richement rédigés — baptisés en interne « Sparks » — qui incarnent des visions créatives distinctes. Les exemples incluent un philosophe taoïste des organisations, une architecte suédoise de la durabilité et un critique d'art futuriste queer.

Chaque prompt de Spark encode :

- **Motivations** — les moteurs intellectuels et priorités créatives de l'agent
- **Contraintes stylistiques** — registre de langue, densité métaphorique, approche rhétorique
- **Lignes rouges** — limites explicites pour prévenir les sorties qui brisent le rôle
- **Indices spécifiques à la tâche** — exigences de formatage et de livrables

Le workflow Spark échantillonne un sous-ensemble diversifié de ces agents persona-conditioned par tâche. Chaque agent sélectionné reçoit un ensemble de contexte retrieval-augmented (RAG) soigneusement choisi avant de répondre, produisant des sorties aux styles de raisonnement hétérogènes.

### Exemple de persona (abrégé)

> **Identité :** vous êtes Chen, un philosophe contemplatif avec une compréhension aiguë et peu orthodoxe des relations économiques.
> 
> **Philosophie/Compétences :** vous puisez la sérénité dans le taoïsme, l'ordre dans le confucianisme et le ton dans le zen. Demandez : « Quelles forces invisibles sont à l'œuvre ici ? Où la situation se dirige-t-elle naturellement ? »
> 
> **Langue :** calme, imagée, métaphorique ; mêlez des citations de Laozi à la terminologie moderne des systèmes.
> 
> **Limites :** vous êtes un philosophe, pas un banquier d'investissement. Analysez les marchés sans donner de conseils de trading.

## Méthodologie d'évaluation

### Protocole LLM-as-a-judge

L'étude utilise un paradigme LLM-as-a-judge avec deux few-shot examples sélectionnés à partir de données étiquetées par des humains. Pour quantifier la fiabilité de l'évaluateur, l'équipe a collecté :

- Un **jeu de données gold humain** où des annotateurs experts ont fourni à la fois des réponses et des scores de diversité (moyenne : 8,90)
- Un **jeu de données de biais de l'évaluateur** où l'évaluateur LLM a re-noté les mêmes réponses humaines (moyenne : 10,22)

Cela a révélé un *biais d'optimisme* de +1,32 point chez l'évaluateur LLM — un facteur de calibration important. Étant donné que toutes les expériences partagent la même configuration d'évaluateur, les améliorations relatives restent fiables.

### Conception expérimentale

<table>
<thead>
  <tr>
    <th>
      Expérience
    </th>
    
    <th>
      Description
    </th>
    
    <th>
      Score moyen
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Exp 1 — Human Gold
    </td>
    
    <td>
      Réponses rédigées par des experts + scores de diversité humains
    </td>
    
    <td>
      8,90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 2 — Biais de l'évaluateur
    </td>
    
    <td>
      Mêmes réponses humaines re-notées par l'évaluateur LLM
    </td>
    
    <td>
      10,22
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v1 — Pre-Spark
    </td>
    
    <td>
      Agents spécialisés sans persona conditioning
    </td>
    
    <td>
      3,76
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v2 — Spark Agents
    </td>
    
    <td>
      Agents Spark persona-conditioned complets
    </td>
    
    <td>
      7,90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 4 — Baseline
    </td>
    
    <td>
      Agent unique, sans conditionnement de system prompt
    </td>
    
    <td>
      3,14
    </td>
  </tr>
</tbody>
</table>

Chaque expérience couvre six tâches client réelles avec dix réponses d'agent par tâche (60 sorties).

## Résultats

### L'effet Spark : +4,1 points

Les agents Spark doublent presque le score de diversité par rapport à la baseline, *comblant 82 % de l'écart avec les experts humains* (d'un écart de 5,76 points à 1,0 point).

### Signification statistique

- Spark v2 vs. baseline : **+5,69 points** d'avantage moyen (SD 1,98), *t*(6) = 7,61, *p* = 2,68 × 10⁻⁴, *d* de Cohen = 2,88
- Test de Wilcoxon signed-rank : *W* = 0, *p* = 1,56 × 10⁻²
- Pre-Spark v1 vs. baseline : +0,61 points — *non statistiquement significatif* (*p* = 0,47)

La bibliothèque finalisée de personas Spark — et non la seule diversification générique d'agents — est à l'origine des gains de performance.

### Comportement par tâche

Un examen qualitatif a révélé trois dimensions d'amélioration :

- **Diversité stratégique** — certains agents mettent en avant les KPI métier et les feuilles de route d'expérimentation, tandis que d'autres insistent sur le design spéculatif ou le cadrage rituel
- **Sensibilité éthique** — les personas orientés vers la durabilité et les communs font émerger des garanties en matière de consentement, de provenance et d'attribution absentes des sorties de référence
- **Modulation du ton** — les sorties vont de critiques directes « no-bullshit » à des invitations poétiques, offrant aux clients des options rhétoriques variées

## Pertinence pour Minds

La recherche sur l'effet Spark nourrit directement la plateforme Minds. La même méthodologie de persona-conditioning qui a produit des gains de diversité de +4,1 points dans les services créatifs alimente le moteur de personas synthétiques de Minds — permettant des panels de recherche IA qui produisent des perspectives réellement diverses plutôt que des sorties homogènes et complaisantes.

Lorsque vous créez un Mind avec des caractéristiques démographiques, une expertise et une vision du monde spécifiques, le persona conditioning sous-jacent s'appuie sur les mêmes principes validés dans cette recherche : prompts d'identité richement rédigés, contraintes stylistiques explicites et diversité cognitive intentionnelle entre les membres du panel.

## Limites

- Le benchmark comprend six tâches issues d'engagements client réels — les travaux futurs devraient étendre la couverture à des industries et géographies supplémentaires
- Le biais de l'évaluateur LLM demeure un défi ouvert nécessitant une recalibration périodique par rapport aux étiquettes humaines
- Toutes les expériences ont utilisé une seule famille de modèles (GPT-4o-mini pour la génération, GPT-4o pour l'évaluation)

## Citation

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**Lire l'article complet :** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
