---
title: "Spark Etkisi: Çoklu Ajan AI Sistemlerinde Creative Diversity Mühendisliği Üzerine"
description: "Persona-conditioned LLM ajanları, uniform prompt'lara kıyasla +4,1 puan diversity kazancı sağlıyor; insan uzmanlarla olan farkı yalnızca 1,0 puana indiriyor. Art of X ve HFBK Hamburg tarafından yayımlanan bir beyaz belge."
canonical_url: "https://getminds.ai/research/tr/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:05:39.659Z"
---

# Spark Etkisi: Çoklu Ajan AI Sistemlerinde Creative Diversity Mühendisliği Üzerine

**Yazarlar:** Alexander Doudkin (Art of X), Friedrich von Borries (HFBK Hamburg, Art of X)

**Yayımlanma:** Ekim 2025 — [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**İşbirliği:** Art of X UG AI Research ekibi ve HFBK Hamburg; başlangıç finansmanı Hamburg Open Online University (HOOU) programından sağlanmıştır.

---

## Özet

Yaratıcı hizmet ekipleri fikir geliştirmeyi hızlandırmak için büyük dil modellerine giderek daha fazla güvenmektedir; ancak üretim sistemleri genellikle marka veya sanatsal beklentileri karşılamayan homojen çıktılara yakınsamaktadır. Bu makale, uniform sistem prompt'larının persona-conditioned LLM ajanlarıyla değiştirilmesiyle elde edilen ölçülebilir bir creative diversity iyileştirmesi olan *Spark Etkisi*'ni tanıtmaktadır.

İnsan gold standard'ına göre kalibre edilmiş bir LLM-as-a-judge protokolü kullanarak, uniform bir sistem prompt'unu persona-conditioned Spark ajanları değiştirdiğinde (1–10 ölçeğinde) *ortalama +4,1 puanlık bir diversity kazancı* gözlemliyor ve insan uzmanlarla olan farkı yalnızca 1,0 puana indiriyoruz.

## Sorun: LLM Çıktılarında Creative Homojenlik

Dikkatli prompt mühendisliğine rağmen, üretim LLM sistemleri üç arıza modundan muzdariptir:

1. **Persona çöküşü** — ajanlar yaratıcı brief'ten bağımsız olarak genel bir danışman tonu benimser.
2. **Şablon aşırı uyumu** — benzer kontrol listesi yapıları, çıktılar arasında minimum varyasyonla yeniden belirir.
3. **Karşı-görüş eksikliği** — çıktılar nadiren müşteri varsayımlarına meydan okur veya etik gerilimleri yüzeye çıkarır.

Art of X'te 2024 ortasında yapılan bir iç denetim, genel bir prompt ile tek bir ajandan gelen baseline üretimlerin tekrarlayıcı yapılar etrafında kümelenip müşteri güvenini zayıflattığını doğruladı. Baseline çıktıları için ortalama diversity skoru 10 üzerinden yalnızca 3,14 idi.

## Çözüm: Persona-Conditioned Spark Ajanları

Art of X, dahili olarak "Sparks" olarak markalanmış, farklı yaratıcı dünya görüşlerini somutlaştıran, 60'tan fazla zengin biçimde yazılmış sistem prompt'undan oluşan bir katalog geliştirdi. Örnekler arasında organizasyonların Taocu bir filozofu, İsveçli bir sürdürülebilirlik mimarı ve queer bir fütürist sanat eleştirmeni yer almaktadır.

Her Spark prompt'u şunları kodlar:

- **Motivasyonlar** — ajanın entelektüel itici güçleri ve yaratıcı öncelikleri
- **Stilistik kısıtlamalar** — dil kaydı, metafor yoğunluğu, retorik yaklaşım
- **Kırmızı çizgiler** — rol-kırıcı çıktıları önlemek için açık sınırlar
- **Göreve özgü ipuçları** — biçimlendirme ve teslim edilebilir gereksinimler

Spark iş akışı, görev başına bu persona-conditioned ajanların çeşitli bir alt kümesini örnekler. Seçilen her ajan, yanıt vermeden önce küratörlü bir retrieval-augmented (RAG) bağlam paketi alır ve heterojen akıl yürütme stillerine sahip çıktılar üretir.

### Örnek Persona (Kısaltılmış)

> **Kimlik:** Sen Chen'sin, ekonomik ilişkiler konusunda keskin ve ortodoks olmayan bir anlayışa sahip düşünceli bir filozofsun.
> 
> **Felsefe/Yetkinlikler:** Taoizm'den huzur, Konfüçyüsçülük'ten düzen ve Zen'den ton çekersin. Sor: "Burada hangi görünmez güçler çalışıyor? Durum doğal olarak nereye yöneliyor?"
> 
> **Dil:** Sakin, canlı, metaforik; Laozi'den alıntıları modern sistemler terminolojisiyle harmanla.
> 
> **Sınırlamalar:** Bir filozofsun, yatırım bankacısı değil. Ticaret tavsiyesi vermeden piyasaları analiz et.

## Değerlendirme Metodolojisi

### LLM-as-a-Judge Protokolü

Çalışma, insan etiketli verilerden küratörlenmiş iki few-shot örneği ile LLM-as-a-judge paradigmasını kullanır. Değerlendirici güvenilirliğini nicelleştirmek için ekip şunları topladı:

- Uzman annotatörlerin hem yanıtları hem de diversity skorlarını sağladığı bir **human gold dataset** (ortalama: 8,90)
- LLM değerlendiricisinin aynı insan yanıtlarını yeniden puanladığı bir **evaluator bias dataset** (ortalama: 10,22)

Bu, LLM değerlendiricisinde +1,32 puanlık bir *iyimserlik önyargısını* ortaya çıkardı — önemli bir kalibrasyon faktörü. Tüm deneyler aynı değerlendirici yapılandırmasını paylaştığı için göreli iyileştirmeler güvenilir kalmaktadır.

### Deneysel Tasarım

<table>
<thead>
  <tr>
    <th>
      Deney
    </th>
    
    <th>
      Açıklama
    </th>
    
    <th>
      Ortalama Skor
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Deney 1 — Human Gold
    </td>
    
    <td>
      Uzman-yazılmış yanıtlar + insan diversity skorları
    </td>
    
    <td>
      8,90
    </td>
  </tr>
  
  <tr>
    <td>
      Deney 2 — Evaluator Bias
    </td>
    
    <td>
      Aynı insan yanıtları LLM değerlendiricisi tarafından yeniden puanlandı
    </td>
    
    <td>
      10,22
    </td>
  </tr>
  
  <tr>
    <td>
      Deney 3 v1 — Spark Öncesi
    </td>
    
    <td>
      Persona-conditioning olmadan uzmanlaşmış ajanlar
    </td>
    
    <td>
      3,76
    </td>
  </tr>
  
  <tr>
    <td>
      Deney 3 v2 — Spark Ajanları
    </td>
    
    <td>
      Tam persona-conditioned Spark ajanları
    </td>
    
    <td>
      7,90
    </td>
  </tr>
  
  <tr>
    <td>
      Deney 4 — Baseline
    </td>
    
    <td>
      Tek ajan, sistem prompt conditioning yok
    </td>
    
    <td>
      3,14
    </td>
  </tr>
</tbody>
</table>

Her deney, görev başına on ajan yanıtı ile altı gerçek müşteri görevini kapsar (60 çıktı).

## Sonuçlar

### Spark Etkisi: +4,1 Puan

Spark ajanları, baseline'a göre diversity skorunu neredeyse iki katına çıkararak *insan uzmanlarla olan farkın %82'sini kapatmaktadır* (5,76 puanlık bir farktan 1,0 puana).

### İstatistiksel Anlamlılık

- Spark v2 vs. baseline: **+5,69 puan** ortalama avantaj (SD 1,98), *t*(6) = 7,61, *p* = 2,68 × 10⁻⁴, Cohen's *d* = 2,88
- Wilcoxon signed-rank testi: *W* = 0, *p* = 1,56 × 10⁻²
- Spark öncesi v1 vs. baseline: +0,61 puan — *istatistiksel olarak anlamlı değil* (*p* = 0,47)

Sonuçlandırılmış Spark persona kütüphanesi — tek başına genel ajan çeşitlendirmesi değil — performans kazançlarını yönlendirmektedir.

### Görev Bazlı Davranış

Niteliksel inceleme üç iyileştirme boyutunu ortaya çıkardı:

- **Stratejik yayılım** — bazı ajanlar iş KPI'larını ve deney yol haritalarını ön plana çıkarırken, diğerleri spekülatif tasarımı veya ritüel çerçevelemeyi vurgular
- **Etik duyarlılık** — sürdürülebilirlik ve müşterek odaklı personalar, baseline çıktılarında bulunmayan rıza, köken ve atıf güvencelerini yüzeye çıkarır
- **Ton modülasyonu** — çıktılar, keskin "no-bullshit" eleştirilerden şiirsel davetlere kadar değişerek müşterilere çeşitli retorik seçenekler sunar

## Minds ile İlgisi

Spark Etkisi araştırması, Minds platformunu doğrudan bilgilendirmektedir. Yaratıcı hizmetlerde +4,1 puanlık diversity kazancı üreten aynı persona-conditioning metodolojisi, Minds'ın sentetik persona motorunu yönlendirir — homojen, uzlaşır çıktılar yerine gerçekten çeşitli perspektifler üreten AI araştırma panellerine olanak tanır.

Belirli demografi, uzmanlık ve dünya görüşüyle bir Mind oluşturduğunuzda, temeldeki persona conditioning, bu araştırmada doğrulanan aynı ilkelerden yararlanır: zengin biçimde yazılmış kimlik prompt'ları, açık stilistik kısıtlamalar ve panel üyeleri arasında kasıtlı bilişsel çeşitlilik.

## Sınırlamalar

- Benchmark, gerçek müşteri projelerinden altı görevden oluşmaktadır — gelecekteki çalışmalar kapsamı ek sektörlere ve coğrafyalara genişletmelidir
- LLM evaluator bias, insan etiketlerine karşı periyodik yeniden kalibrasyon gerektiren açık bir zorluk olmaya devam etmektedir
- Tüm deneyler tek bir model ailesi kullandı (üretim için GPT-4o-mini, değerlendirme için GPT-4o)

## Atıf

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**Tam makaleyi okuyun:** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
