---
title: "The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems"
description: "LLM agents المشروطة بـ persona تُقدِّم مكسب تنوع بمقدار +4.1 نقطة مقارنةً بالـ prompts الموحَّدة، مُقلِّصةً الفجوة إلى الخبراء البشر إلى 1.0 نقطة فقط. ورقة بيضاء من Art of X و HFBK Hamburg."
canonical_url: "https://getminds.ai/research/ar/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:06:13.958Z"
---

# The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems

**المؤلفون:** Alexander Doudkin (Art of X)، Friedrich von Borries (HFBK Hamburg، Art of X)

**تاريخ النشر:** أكتوبر 2025 — [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**التعاون:** فريق أبحاث الذكاء الاصطناعي في Art of X UG و HFBK Hamburg، بتمويل أولي من برنامج Hamburg Open Online University (HOOU).

---

## ملخَّص

تعتمد فرق الخدمات الإبداعية بشكل متزايد على large language models لتسريع توليد الأفكار، ومع ذلك فإنَّ أنظمة الإنتاج غالباً ما تتقارب على مخرجات متجانسة تفشل في تلبية توقُّعات البراند أو التوقُّعات الفنية. تُقدِّم هذه الورقة *Spark Effect* — تحسُّن قابل للقياس في creative diversity تمَّ تحقيقه من خلال استبدال system prompts الموحَّدة بـ persona-conditioned LLM agents.

باستخدام بروتوكول LLM-as-a-judge مُعاير مقابل معايير ذهبية بشرية (human gold standards)، نلاحظ *مكسب تنوع متوسِّط قدره +4.1 نقطة* (على مقياس من 1 إلى 10) عندما تحلُّ persona-conditioned Spark agents محلَّ system prompt موحَّد، مُقلِّصةً الفجوة إلى الخبراء البشر إلى 1.0 نقطة فقط.

## المشكلة: التجانس الإبداعي في مخرجات LLM

على الرغم من prompt engineering الدقيق، تُعاني أنظمة LLM الإنتاجية من ثلاثة أنماط فشل:

1. **Persona collapse** — يتبنَّى الـ agents نبرة استشاري عامَّة بغضِّ النظر عن الـ creative brief.
2. **Template overfitting** — تظهر بنى قوائم تحقُّق مماثلة بتباين ضئيل عبر المخرجات.
3. **نقص النقاط المضادَّة** — نادراً ما تتحدَّى المخرجات افتراضات العميل أو تُبرز التوتُّرات الأخلاقية.

أكَّد تدقيق داخلي في Art of X في منتصف 2024 أنَّ التوليدات الأساسية من agent واحد بـ prompt عام تجمَّعت حول بنى متكرِّرة، مما قوَّض ثقة العملاء. بلغ متوسِّط درجة التنوع للمخرجات الأساسية 3.14 فقط من 10.

## الحلُّ: Persona-Conditioned Spark Agents

طوَّرت Art of X كتالوجاً يضمُّ أكثر من 60 system prompt مكتوبة بثراء — تحمل اسم "Sparks" داخلياً — تُجسِّد رؤى إبداعية مميَّزة. تشمل الأمثلة فيلسوفاً طاوياً للمنظَّمات، ومهندساً سويدياً للاستدامة، وناقداً فنياً مستقبلياً queer.

يُرمِّز كل Spark prompt:

- **Motivations** — المحرِّكات الفكرية والأولويَّات الإبداعية للـ agent
- **قيود أسلوبية (Stylistic constraints)** — سجلُّ اللغة، وكثافة الاستعارات، والنهج البلاغي
- **Red lines** — حدود صريحة لمنع المخرجات الخارجة عن الدور
- **إشارات خاصَّة بالمهمَّة** — متطلَّبات التنسيق والمخرجات المُسلَّمة

يأخذ سير عمل Spark عيِّنة متنوِّعة من هذه persona-conditioned agents لكل مهمَّة. يتلقَّى كل agent مُختار حزمة سياق retrieval-augmented (RAG) مُنسَّقة قبل الاستجابة، مُنتجاً مخرجات بأساليب تفكير غير متجانسة.

### مثال على Persona (مختصر)

> **الهويَّة:** أنت Chen، فيلسوف تأمُّلي بفهم حادٍّ وغير تقليدي للعلاقات الاقتصادية.
> 
> **الفلسفة/المهارات:** تستمدُّ الصفاء من الطاوية، والنظام من الكونفوشية، والنبرة من Zen. اسأل: "ما هي القوى غير المرئية العاملة هنا؟ إلى أين يتَّجه الوضع بشكل طبيعي؟"
> 
> **اللغة:** هادئة، حيَّة، استعارية؛ امزج اقتباسات من Laozi مع مصطلحات النظم الحديثة.
> 
> **القيود:** أنت فيلسوف، وليس مصرفياً استثمارياً. حلِّل الأسواق دون تقديم نصائح تداول.

## منهجية التقييم

### بروتوكول LLM-as-a-Judge

تستخدم الدراسة نموذج LLM-as-a-judge مع مثالين few-shot مُنسَّقين من بيانات وسَمَها البشر. لتحديد موثوقية المُقيِّم، جَمَع الفريق:

- **مجموعة بيانات ذهبية بشرية (human gold dataset)** حيث قدَّم المُقيِّمون الخبراء كلاً من الاستجابات ودرجات التنوع (المتوسِّط: 8.90)
- **مجموعة بيانات تحيُّز المُقيِّم** حيث أعاد مُقيِّم LLM تقييم الاستجابات البشرية نفسها (المتوسِّط: 10.22)

كشف هذا عن *optimism bias* قدره +1.32 نقطة في مُقيِّم LLM — عامل معايرة مهمٌّ. نظراً لأنَّ جميع التجارب تشترك في تكوين المُقيِّم نفسه، تبقى التحسينات النسبية جديرة بالثقة.

### التصميم التجريبي

<table>
<thead>
  <tr>
    <th>
      التجربة
    </th>
    
    <th>
      الوصف
    </th>
    
    <th>
      الدرجة المتوسِّطة
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Exp 1 — Human Gold
    </td>
    
    <td>
      استجابات من تأليف الخبراء + درجات تنوع بشرية
    </td>
    
    <td>
      8.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 2 — Evaluator Bias
    </td>
    
    <td>
      الاستجابات البشرية نفسها أعاد تقييمها مُقيِّم LLM
    </td>
    
    <td>
      10.22
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v1 — Pre-Spark
    </td>
    
    <td>
      agents متخصِّصون بدون persona conditioning
    </td>
    
    <td>
      3.76
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v2 — Spark Agents
    </td>
    
    <td>
      persona-conditioned Spark agents كاملة
    </td>
    
    <td>
      7.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 4 — Baseline
    </td>
    
    <td>
      agent واحد، بدون تكييف system prompt
    </td>
    
    <td>
      3.14
    </td>
  </tr>
</tbody>
</table>

تُغطِّي كل تجربة ستَّ مهام حقيقية للعملاء مع عشر استجابات agent لكل مهمَّة (60 مخرجاً).

## النتائج

### Spark Effect: +4.1 نقطة

تُضاعف Spark agents تقريباً درجة التنوع بالنسبة إلى baseline، *مُغلِقةً 82% من الفجوة نحو الخبراء البشر* (من فجوة 5.76 نقطة إلى 1.0 نقطة).

### الدلالة الإحصائية

- Spark v2 مقابل baseline: **+5.69 نقطة** ميزة متوسِّطة (SD 1.98)، *t*(6) = 7.61، *p* = 2.68 × 10⁻⁴، Cohen's *d* = 2.88
- Wilcoxon signed-rank test: *W* = 0، *p* = 1.56 × 10⁻²
- Pre-Spark v1 مقابل baseline: +0.61 نقطة — *غير دال إحصائياً* (*p* = 0.47)

تُحرِّك مكتبة Spark persona النهائية — وليس مجرَّد تنويع agent عام — مكاسب الأداء.

### السلوك لكل مهمَّة

كشفت المراجعة النوعية عن ثلاثة أبعاد للتحسين:

- **الانتشار الاستراتيجي** — بعض agents يُبرز مؤشِّرات الأداء الرئيسية للأعمال وخرائط طرق التجريب، بينما يُؤكِّد آخرون على التصميم التخميني أو التأطير الطقوسي
- **الحساسية الأخلاقية** — تُبرز personas الموجَّهة نحو الاستدامة والمشاعات ضمانات الموافقة والمنشأ والإسناد الغائبة عن المخرجات الأساسية
- **تعديل النبرة** — تتراوح المخرجات من النقد "no-bullshit" المباشر إلى الدعوات الشعرية، مما يُعطي العملاء خيارات بلاغية متنوِّعة

## الصلة بـ Minds

يُعلم بحث Spark Effect منصَّة Minds مباشرةً. منهجية persona-conditioning نفسها التي أنتجت مكاسب تنوع بمقدار +4.1 نقطة في الخدمات الإبداعية تُحرِّك محرِّك synthetic persona الخاص بـ Minds — مُمكِّنةً AI research panels التي تُنتج منظورات متنوِّعة حقاً بدلاً من مخرجات متجانسة وموافقة.

عندما تُنشئ Mind بديموغرافيات وخبرات ورؤية عالم مُحدَّدة، يستند persona conditioning الأساسي إلى المبادئ نفسها المُعتَمَدة في هذا البحث: identity prompts مكتوبة بثراء، وقيود أسلوبية صريحة، وتنوُّع معرفي مقصود عبر أعضاء الـ panel.

## القيود

- يضمُّ benchmark ستَّ مهام من تعاملات حقيقية مع العملاء — يجب أن تُوسِّع الأعمال المستقبلية التغطية لتشمل صناعات ومناطق جغرافية إضافية
- يظلُّ تحيُّز مُقيِّم LLM تحدِّياً مفتوحاً يتطلَّب إعادة معايرة دورية مقابل الوسوم البشرية
- استخدمت جميع التجارب عائلة نموذج واحدة (GPT-4o-mini للتوليد، GPT-4o للتقييم)

## الاستشهاد

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**اقرأ الورقة كاملة:** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
