---
title: "스파크 효과: 다중 에이전트 AI 시스템에서 창의적 다양성 공학"
description: "페르소나 조건화된 LLM 에이전트는 균일한 프롬프트에 비해 +4.1 포인트의 다양성 향상을 제공하며, 인간 전문가와의 격차를 단 1.0 포인트로 좁힙니다. Art of X와 HFBK 함부르크의 백서."
canonical_url: "https://getminds.ai/research/ko/spark-effect-creative-diversity-multi-agent-ai"
last_updated: "2026-08-13T13:05:40.071Z"
---

# 스파크 효과: 다중 에이전트 AI 시스템에서 창의적 다양성 공학

**저자:** Alexander Doudkin (Art of X), Friedrich von Borries (HFBK 함부르크, Art of X)

**발행일:** 2025년 10월 , [arXiv:2510.15568](https://arxiv.org/abs/2510.15568)

**협력:** Art of X UG AI 연구팀과 HFBK 함부르크, 함부르크 오픈 온라인 대학교(HOOU) 프로그램의 초기 자금 지원.

---

## 요약

창의적 서비스 팀은 아이디어 발상을 가속화하기 위해 대규모 언어 모델에 점점 더 의존하고 있지만, 생산 시스템은 종종 브랜드나 예술적 기대를 충족하지 못하는 동질적인 출력으로 수렴합니다. 이 논문은 균일한 시스템 프롬프트를 페르소나 조건화된 LLM 에이전트로 대체하여 달성한 창의적 다양성의 측정 가능한 개선인 *스파크 효과*를 소개합니다.

인간 금 표준에 대해 보정된 LLM-심사관 프로토콜을 사용하여, 페르소나 조건화된 스파크 에이전트가 균일한 시스템 프롬프트를 대체할 때 *평균 다양성 향상 +4.1 포인트* (1–10 척도 기준)를 관찰하며, 인간 전문가와의 격차를 단 1.0 포인트로 좁힙니다.

## 문제: LLM 출력의 창의적 동질성

신중한 프롬프트 공학에도 불구하고, 생산 LLM 시스템은 세 가지 실패 모드에 시달립니다:

1. **페르소나 붕괴** , 에이전트가 창의적 브리프와 관계없이 일반적인 컨설턴트 톤을 채택합니다.
2. **템플릿 과적합** , 유사한 체크리스트 구조가 출력 전반에 걸쳐 최소한의 변형으로 반복됩니다.
3. **반론 부족** , 출력은 고객의 가정을 거의 도전하지 않거나 윤리적 긴장을 드러내지 않습니다.

2024년 중반 Art of X의 내부 감사 결과, 일반 프롬프트를 가진 단일 에이전트의 기본 생성물이 반복적인 구조로 클러스터링되어 고객 신뢰를 저해한다는 것이 확인되었습니다. 기본 출력의 평균 다양성 점수는 단 3.14점에 불과했습니다.

## 해결책: 페르소나 조건화된 스파크 에이전트

Art of X는 독특한 창의적 세계관을 구현한 60개 이상의 풍부하게 작성된 시스템 프롬프트 카탈로그를 개발했습니다 , 내부적으로 "스파크"라고 브랜드화되었습니다. 예를 들어, 조직의 도교 철학자, 스웨덴의 지속 가능성 건축가, 퀴어 미래주의 미술 비평가 등이 있습니다.

각 스파크 프롬프트는 다음을 인코딩합니다:

- **동기** , 에이전트의 지적 동기와 창의적 우선순위
- **스타일 제약** , 언어 등록, 은유 밀도, 수사적 접근
- **레드라인** , 역할 파괴 출력을 방지하기 위한 명시적 경계
- **작업별 큐** , 형식 및 결과물 요구 사항

스파크 워크플로우는 각 작업에 대해 이러한 페르소나 조건화된 에이전트의 다양한 하위 집합을 샘플링합니다. 선택된 각 에이전트는 응답하기 전에 큐레이션된 검색 보강(RAG) 컨텍스트 번들을 수신하여 이질적인 추론 스타일로 출력을 생성합니다.

### 예시 페르소나 (요약)

> **정체성:** 당신은 경제적 관계에 대한 날카롭고 비정통적인 이해를 가진 사색적인 철학자입니다.
> 
> **철학/기술:** 당신은 도교에서 평온을, 유교에서 질서를, 선에서 톤을 얻습니다. 질문하세요: "여기에서 어떤 보이지 않는 힘이 작용하고 있나요? 상황은 자연스럽게 어디로 향하고 있나요?"
> 
> **언어:** 차분하고 생생하며 은유적; 노자와 현대 시스템 용어를 혼합하여 인용합니다.
> 
> **제한 사항:** 당신은 철학자이지 투자 은행가가 아닙니다. 거래 조언 없이 시장을 분석하세요.

## 평가 방법론

### LLM-심사관 프로토콜

이 연구는 인간 레이블 데이터에서 선별된 두 개의 몇 가지 사례를 포함한 LLM-심사관 패러다임을 사용합니다. 평가자 신뢰성을 정량화하기 위해 팀은 다음을 수집했습니다:

- **인간 금 데이터셋** , 전문가 주석자가 응답과 다양성 점수(평균: 8.90)를 제공한 데이터셋
- **평가자 편향 데이터셋** , LLM 평가자가 동일한 인간 응답을 재점수한 데이터셋 (평균: 10.22)

이로 인해 LLM 평가자에게 +1.32 포인트의 *낙관적 편향*이 드러났습니다 , 중요한 보정 요소입니다. 모든 실험이 동일한 평가자 구성을 공유하므로 상대적 개선은 신뢰할 수 있습니다.

### 실험 설계

<table>
<thead>
  <tr>
    <th>
      실험
    </th>
    
    <th>
      설명
    </th>
    
    <th>
      평균 점수
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Exp 1 , 인간 금
    </td>
    
    <td>
      전문가가 작성한 응답 + 인간 다양성 점수
    </td>
    
    <td>
      8.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 2 , 평가자 편향
    </td>
    
    <td>
      LLM 평가자가 재점수한 동일한 인간 응답
    </td>
    
    <td>
      10.22
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v1 , 프리 스파크
    </td>
    
    <td>
      페르소나 조건화 없는 전문 에이전트
    </td>
    
    <td>
      3.76
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 3 v2 , 스파크 에이전트
    </td>
    
    <td>
      완전 페르소나 조건화된 스파크 에이전트
    </td>
    
    <td>
      7.90
    </td>
  </tr>
  
  <tr>
    <td>
      Exp 4 , 기준선
    </td>
    
    <td>
      단일 에이전트, 시스템 프롬프트 조건화 없음
    </td>
    
    <td>
      3.14
    </td>
  </tr>
</tbody>
</table>

각 실험은 실제 클라이언트 작업 여섯 개를 다루며, 작업당 열 개의 에이전트 응답(총 60개 출력)을 포함합니다.

## 결과

### 스파크 효과: +4.1 포인트

스파크 에이전트는 기준선에 비해 다양성 점수를 거의 두 배로 증가시켜, *인간 전문가와의 격차를 82% 줄입니다* (5.76 포인트 격차에서 1.0 포인트로).

### 통계적 유의성

- 스파크 v2 vs. 기준선: **+5.69 포인트** 평균 이점 (SD 1.98), *t*(6) = 7.61, *p* = 2.68 × 10⁻⁴, Cohen의 *d* = 2.88
- 윌콕슨 부호 순위 검정: *W* = 0, *p* = 1.56 × 10⁻²
- 프리 스파크 v1 vs. 기준선: +0.61 포인트 , *통계적으로 유의하지 않음* (*p* = 0.47)

최종 스파크 페르소나 라이브러리 , 단순한 일반 에이전트 다양화가 아닌 , 성능 향상을 이끌어냅니다.

### 작업별 행동

정성적 검토 결과 세 가지 개선 차원이 드러났습니다:

- **전략적 확산** , 일부 에이전트는 비즈니스 KPI와 실험 로드맵을 강조하고, 다른 에이전트는 투기적 디자인이나 의식적 프레이밍을 강조합니다.
- **윤리적 민감성** , 지속 가능성 및 공공재 지향 페르소나는 기본 출력에서 결여된 동의, 출처, 귀속 보호 장치를 드러냅니다.
- **톤 조절** , 출력은 직설적인 "노-불릿" 비판부터 시적인 초대까지 다양하여 고객에게 다양한 수사적 옵션을 제공합니다.

## Minds와의 관련성

스파크 효과 연구는 Minds 플랫폼에 직접적인 정보를 제공합니다. +4.1 포인트의 다양성 향상을 가져온 동일한 페르소나 조건화 방법론이 Minds의 합성 페르소나 엔진을 구동하여 동질적이고 동의하는 출력을 넘어 진정으로 다양한 관점을 생성하는 AI 연구 패널을 가능하게 합니다.

특정 인구 통계, 전문성 및 세계관으로 Mind를 생성할 때, 기본 페르소나 조건화는 이 연구에서 검증된 동일한 원칙을 기반으로 합니다: 풍부하게 작성된 정체성 프롬프트, 명시적 스타일 제약, 패널 구성원 간의 의도적인 인지적 다양성.

## 한계

- 기준선은 실제 클라이언트 참여에서 여섯 개의 작업으로 구성됩니다 , 향후 작업은 추가 산업 및 지리로 범위를 확장해야 합니다.
- LLM 평가자 편향은 인간 레이블에 대한 주기적인 재보정이 필요한 열린 도전 과제입니다.
- 모든 실험은 단일 모델 계열(GPT-4o-mini로 생성, GPT-4o로 평가)을 사용했습니다.

## 인용

```text
@article{doudkin2025spark,
  title={The Spark Effect: On Engineering Creative Diversity in Multi-Agent AI Systems},
  author={Doudkin, Alexander and von Borries, Friedrich},
  journal={arXiv preprint arXiv:2510.15568},
  year={2025}
}
```

**전체 논문 읽기:** [arXiv:2510.15568](https://arxiv.org/abs/2510.15568) ([PDF](https://arxiv.org/pdf/2510.15568))
