---
title: "지연 시간"
description: "응답 지연 시간(Latency)의 개념과 지연 시간을 유발하는 요인, 그리고 파운데이션 모델을 직접 호출할 때와의 속도 비교 분석을 확인해 보세요."
---

# 지연 시간

Minds API 응답 시간이 파운데이션 모델을 직접 호출할 때와 어떻게 다른지, 그리고 이러한 차이가 발생하는 요인이 무엇인지 알아봅니다.

## 개요

Minds API를 통해 메시지를 보내면, 단순히 LLM을 직접 호출하는 것 이상의 작업이 수행됩니다. API는 마인드(mind)의 지식 베이스를 바탕으로 답변의 근거를 마련(grounding)하기 위해 여러 단계를 조율하며, 이를 통해 맥락에 맞는 고품질의 답변을 제공합니다.

**일반적인 응답 시간:**

<table>
<thead>
  <tr>
    <th>
      시나리오
    </th>
    
    <th>
      지연 시간
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      파운데이션 모델 직접 호출 (맥락 없음)
    </td>
    
    <td>
      1-3초
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (지식 근거 마련 포함)
    </td>
    
    <td>
      5-12초
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (단순 인사 / RAG 미적용)
    </td>
    
    <td>
      2-4초
    </td>
  </tr>
</tbody>
</table>

추가로 소요되는 시간은 지식 검색 및 근거 마련(grounding)에 사용되며, 이 과정 덕분에 Minds는 단순 LLM 호출보다 더 정확하고 맥락에 맞는 답변을 제공할 수 있습니다.

## 요청 처리 과정

`POST /api/v1/minds/{mindId}/completion`를 호출하면 API는 다음 단계를 수행합니다:

```text
1. Authentication & mind loading          ~50ms
2. Knowledge retrieval (RAG)              ~1-3s
   - Semantic search across embeddings
   - Retrieve relevant knowledge chunks
3. Tool orchestration                     ~1-3s
   - Web search (if needed)
   - Knowledge grounding & citations
4. LLM generation                         ~1-3s
   - Same latency as calling the model directly
5. Response formatting & citations         ~50ms
```

**단계 2와 3은 Minds가 단순 API 호출과 차별화되는 핵심 요소입니다.** 이 단계를 통해 마인드의 지식 베이스, 웹 검색 결과, 그리고 근거가 확실한 인용구로부터 관련 맥락을 마인드에 제공합니다.

## 벤치마크 결과

2026년 3월 12일 측정 기준입니다. 각 테스트는 동일한 프롬프트로 3회씩 실행되었습니다. Minds API 호출에는 전체 RAG 파이프라인 및 도구 조율(tool orchestration) 과정이 포함되어 있습니다.

### 모델별 응답 시간

<table>
<thead>
  <tr>
    <th>
      엔드포인트
    </th>
    
    <th>
      평균
    </th>
    
    <th>
      최소
    </th>
    
    <th>
      최대
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds API (default)
      </strong>
    </td>
    
    <td>
      12,166ms
    </td>
    
    <td>
      10,951ms
    </td>
    
    <td>
      13,910ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o)
      </strong>
    </td>
    
    <td>
      7,013ms
    </td>
    
    <td>
      5,900ms
    </td>
    
    <td>
      8,203ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o-mini)
      </strong>
    </td>
    
    <td>
      6,651ms
    </td>
    
    <td>
      4,702ms
    </td>
    
    <td>
      7,975ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gemini-2.5-flash)
      </strong>
    </td>
    
    <td>
      7,553ms
    </td>
    
    <td>
      5,170ms
    </td>
    
    <td>
      11,198ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o)
    </td>
    
    <td>
      1,461ms
    </td>
    
    <td>
      1,139ms
    </td>
    
    <td>
      1,720ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o-mini)
    </td>
    
    <td>
      1,784ms
    </td>
    
    <td>
      1,589ms
    </td>
    
    <td>
      1,925ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct Google (gemini-2.5-flash)
    </td>
    
    <td>
      1,593ms
    </td>
    
    <td>
      1,466ms
    </td>
    
    <td>
      1,701ms
    </td>
  </tr>
</tbody>
</table>

### 오버헤드 세부 분석

<table>
<thead>
  <tr>
    <th>
      모델
    </th>
    
    <th>
      Minds API
    </th>
    
    <th>
      직접 호출
    </th>
    
    <th>
      오버헤드
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      gpt-4o-mini
    </td>
    
    <td>
      6,651ms
    </td>
    
    <td>
      1,784ms
    </td>
    
    <td>
      +4,867ms
    </td>
  </tr>
  
  <tr>
    <td>
      gpt-4o
    </td>
    
    <td>
      7,013ms
    </td>
    
    <td>
      1,461ms
    </td>
    
    <td>
      +5,551ms
    </td>
  </tr>
  
  <tr>
    <td>
      gemini-2.5-flash
    </td>
    
    <td>
      7,553ms
    </td>
    
    <td>
      1,593ms
    </td>
    
    <td>
      +5,960ms
    </td>
  </tr>
</tbody>
</table>

테스트된 모든 모델의 **평균 오버헤드는 약 5.5초**입니다. 이 오버헤드에는 다음 작업이 포함됩니다:

- 마인드의 벡터 임베딩에 대한 시맨틱 검색
- 지식 청크 검색 및 순위 지정
- 웹 검색 검증 (해당하는 경우)
- 인용구 매핑 및 답변 근거 마련
- 도구 조율(Tool orchestration) 파이프라인

## 오버헤드가 제공하는 가치

추가적인 지연 시간은 지능을 얻기 위한 비용입니다. 단순 LLM 호출은 비즈니스 도메인에 대한 맥락을 전혀 알지 못합니다. Minds는 다음과 같은 가치를 제공합니다:

1. **지식 근거 마련 (Knowledge grounding)**: 모델의 학습 데이터에만 의존하지 않고, 마인드의 특정 지식 베이스를 바탕으로 답변합니다.
2. **자동 인용구 생성**: 답변의 바탕이 된 출처를 정확히 파악할 수 있습니다.
3. **웹 검색 검증**: 실시간 웹 데이터와 교차 검증하여 지식을 보완합니다.
4. **일관된 페르소나**: 마인드의 고유한 성격과 커뮤니케이션 스타일을 유지하며 답변합니다.
5. **사고 패턴**: 마인드가 추론하는 방식을 형성하는 심리학적 모델링을 적용합니다.

## 지연 시간 최적화하기

### 적절한 모델 선택

상황에 따라 더 빠른 모델을 선택하려면 `model` 매개변수를 사용하세요:

```bash
# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/minds/{mindId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'
```

**모델 속도 순위** (가장 빠른 순):

1. `gpt-4o-mini` / `gemini-3.7-flash` - 속도가 중요한 유스케이스에 가장 적합
2. `gpt-4o` / `claude-sonnet-4-5` - 속도와 품질의 균형
3. 기본값 (서버 선택) - 품질에 최적화됨

### 메시지를 간결하게 유지

대화 기록이 짧을수록 처리 시간이 단축됩니다. `messages` 배열에는 관련 있는 맥락만 포함하세요.

### 마인드 예열 (Warm Minds)

일정 기간 비활성 상태였던 마인드에 보내는 첫 번째 요청은 콜드 스타트(cold-start) 영향으로 인해 다소 느릴 수 있습니다. 이후의 요청은 캐시된 임베딩과 예열된 연결 덕분에 더 빠르게 처리됩니다.

## 스트리밍 (출시 예정)

완성(completion) 엔드포인트에 대한 스트리밍 지원을 준비 중입니다. 이를 통해 전체 답변이 생성되는 동안 첫 번째 토큰을 훨씬 빠르게 전달할 수 있습니다. 대화형 애플리케이션에서 사용자가 체감하는 지연 시간이 크게 단축될 것입니다.

## 호출 비율 제한 (Rate Limits)

v1 API는 인증된 계정별로 설정 가능한 고정 시간 창 제한(기본값 분당 300개 요청)을 적용합니다. `RateLimit-*` 헤더를 읽고 `429` 이후에는 `Retry-After`를 따르며 동시 요청 수를 제한하세요. [에러 및 제한 사항](/docs/api/errors)을 참조하세요.

## 다음 단계

- [Chat API](/docs/api/chat) - 메시지 전송 및 응답 받기
- [Knowledge API](/docs/api/knowledge) - 스파크(Mind)의 지식 베이스 관리
- [API 개요](/docs/api/overview) - 전체 엔드포인트 레퍼런스
