---
title: "El Efecto Spark: ingeniería de la creative diversity en sistemas de IA multi-agent"
description: "Los agentes LLM persona-conditioned aportan una mejora de +4,1 puntos en creative diversity frente a los prompts uniformes, reduciendo la distancia con los expertos humanos a tan solo 1,0 punto. Un white paper de Art of X y la HFBK Hamburg."
canonical_url: "https://getminds.ai/research/es/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:06:11.909Z"
---

# El Efecto Spark: ingeniería de la creative diversity en sistemas de IA multi-agent

**Autores:** Alexander Doudkin (Art of X), Friedrich von Borries (HFBK Hamburg, Art of X)

**Publicado:** Octubre de 2025 — [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**Colaboración:** Equipo de AI Research de Art of X UG y la HFBK Hamburg, con financiación inicial del programa Hamburg Open Online University (HOOU).

---

## Resumen

Los equipos de servicios creativos recurren cada vez más a los large language models para acelerar la ideación, pero los sistemas en producción suelen converger hacia outputs homogéneos que no cumplen con las expectativas de marca o artísticas. Este paper presenta el *Efecto Spark*: una mejora medible en la creative diversity que se consigue al sustituir los system prompts uniformes por agentes LLM persona-conditioned.

Usando un protocolo de LLM-as-a-judge calibrado frente a un gold standard humano, observamos una *mejora media en diversity de +4,1 puntos* (en una escala de 1–10) cuando los Spark agents persona-conditioned reemplazan a un system prompt uniforme, reduciendo la distancia con los expertos humanos a tan solo 1,0 punto.

## El problema: homogeneidad creativa en los outputs de los LLM

A pesar de un prompt engineering cuidado, los sistemas LLM en producción sufren tres modos de fallo:

1. **Persona collapse**: los agentes adoptan un tono genérico de consultor con independencia del brief creativo.
2. **Template overfitting**: estructuras tipo checklist similares reaparecen con mínima variación entre outputs.
3. **Ausencia de counterpoints**: los outputs rara vez desafían las suposiciones del cliente o sacan a la luz tensiones éticas.

Una auditoría interna realizada en Art of X a mediados de 2024 confirmó que las generaciones baseline de un único agente con un prompt genérico se agrupaban en estructuras repetitivas, socavando la confianza del cliente. La puntuación media de diversity para los outputs baseline fue de tan solo 3,14 sobre 10.

## La solución: Spark agents persona-conditioned

Art of X desarrolló un catálogo de más de 60 system prompts ricamente redactados —con la marca interna de "Sparks"— que encarnan distintas visiones creativas del mundo. Algunos ejemplos: un filósofo taoísta de las organizaciones, una arquitecta sueca de la sostenibilidad y una crítica de arte queer y futurista.

Cada prompt de Spark codifica:

- **Motivations**: los impulsos intelectuales y las prioridades creativas del agente
- **Stylistic constraints**: registro lingüístico, densidad metafórica, enfoque retórico
- **Red lines**: límites explícitos para evitar outputs que rompan el rol
- **Task-specific cues**: requisitos de formato y entregables

El workflow de Spark muestrea un subconjunto diverso de estos agentes persona-conditioned por tarea. Cada agente seleccionado recibe un bundle curado de contexto retrieval-augmented (RAG) antes de responder, produciendo outputs con estilos de razonamiento heterogéneos.

### Ejemplo de persona (abreviado)

> **Identidad:** Eres Chen, un filósofo contemplativo con una comprensión aguda y poco ortodoxa de las relaciones económicas.
> 
> **Filosofía/Habilidades:** Sacas serenidad del taoísmo, orden del confucianismo y tono del zen. Pregúntate: "¿Qué fuerzas invisibles están actuando aquí? ¿Hacia dónde se dirige la situación de manera natural?"
> 
> **Lenguaje:** Sereno, vívido, metafórico; mezcla citas de Laozi con terminología moderna de sistemas.
> 
> **Limitaciones:** Eres un filósofo, no un banquero de inversión. Analiza los mercados sin dar consejos de trading.

## Metodología de evaluación

### Protocolo de LLM-as-a-judge

El estudio utiliza un paradigma de LLM-as-a-judge con dos ejemplos few-shot curados a partir de datos etiquetados por humanos. Para cuantificar la fiabilidad del evaluador, el equipo recopiló:

- Un **human gold dataset** en el que anotadores expertos aportaron tanto las respuestas como las puntuaciones de diversity (media: 8,90)
- Un **evaluator bias dataset** en el que el evaluador LLM reevaluó las mismas respuestas humanas (media: 10,22)

Esto reveló un *sesgo de optimismo* de +1,32 puntos en el evaluador LLM, un factor de calibración importante. Como todos los experimentos comparten la misma configuración de evaluador, las mejoras relativas siguen siendo fiables.

### Diseño experimental

<table>
<thead>
  <tr>
    <th>
      Experimento
    </th>
    
    <th>
      Descripción
    </th>
    
    <th>
      Puntuación media
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Exp 1 — Human Gold
    </td>
    
    <td>
      Respuestas redactadas por expertos + puntuaciones de diversity humanas
    </td>
    
    <td>
      8,90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 2 — Evaluator Bias
    </td>
    
    <td>
      Las mismas respuestas humanas reevaluadas por el evaluador LLM
    </td>
    
    <td>
      10,22
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v1 — Pre-Spark
    </td>
    
    <td>
      Agentes especializados sin persona conditioning
    </td>
    
    <td>
      3,76
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v2 — Spark Agents
    </td>
    
    <td>
      Spark agents persona-conditioned completos
    </td>
    
    <td>
      7,90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 4 — Baseline
    </td>
    
    <td>
      Un único agente, sin system prompt conditioning
    </td>
    
    <td>
      3,14
    </td>
  </tr>
</tbody>
</table>

Cada experimento abarca seis tareas reales de clientes con diez respuestas de agentes por tarea (60 outputs).

## Resultados

### El Efecto Spark: +4,1 puntos

Los Spark agents casi duplican la puntuación de diversity respecto al baseline, *cerrando el 82 % de la distancia con los expertos humanos* (desde una brecha de 5,76 puntos hasta 1,0 punto).

### Significancia estadística

- Spark v2 vs. baseline: ventaja media de **+5,69 puntos** (SD 1,98), *t*(6) = 7,61, *p* = 2,68 × 10⁻⁴, *d* de Cohen = 2,88
- Test de Wilcoxon de rangos con signo: *W* = 0, *p* = 1,56 × 10⁻²
- Pre-Spark v1 vs. baseline: +0,61 puntos — *no estadísticamente significativo* (*p* = 0,47)

La biblioteca finalizada de personas Spark —y no la mera diversificación genérica de agentes— es la que impulsa las mejoras de rendimiento.

### Comportamiento por tarea

Una revisión cualitativa reveló tres dimensiones de mejora:

- **Dispersión estratégica**: algunos agentes ponen en primer plano los KPI de negocio y los roadmaps de experimentación, mientras que otros enfatizan el diseño especulativo o los marcos rituales
- **Sensibilidad ética**: las personas orientadas a la sostenibilidad y a los commons sacan a la luz salvaguardas de consentimiento, procedencia y atribución ausentes en los outputs del baseline
- **Modulación de tono**: los outputs van desde críticas directas "no-bullshit" hasta invitaciones poéticas, ofreciendo a los clientes opciones retóricas variadas

## Relevancia para Minds

La investigación sobre el Efecto Spark informa directamente a la plataforma Minds. La misma metodología de persona conditioning que produjo mejoras de diversity de +4,1 puntos en servicios creativos impulsa el motor de personas sintéticas de Minds, permitiendo paneles de research con IA que generan perspectivas genuinamente diversas en lugar de outputs homogéneos y complacientes.

Cuando creas un Mind con demografía, pericia y cosmovisión específicas, el persona conditioning subyacente se apoya en los mismos principios validados en esta investigación: prompts de identidad ricamente redactados, stylistic constraints explícitos y diversidad cognitiva intencionada entre los miembros del panel.

## Limitaciones

- El benchmark comprende seis tareas de encargos reales de clientes; trabajos futuros deberían ampliar la cobertura a industrias y geografías adicionales
- El sesgo del evaluador LLM sigue siendo un reto abierto que requiere recalibración periódica frente a etiquetas humanas
- Todos los experimentos utilizaron una única familia de modelos (GPT-4o-mini para la generación, GPT-4o para la evaluación)

## Cita

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**Lee el paper completo:** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
