Minds Team

지연 시간

응답 지연 시간(Latency)의 개념과 지연 시간을 유발하는 요인, 그리고 파운데이션 모델을 직접 호출할 때와의 속도 비교 분석을 확인해 보세요.

Minds API 응답 시간이 파운데이션 모델을 직접 호출할 때와 어떻게 다른지, 그리고 이러한 차이가 발생하는 요인이 무엇인지 알아봅니다.

개요

Minds API를 통해 메시지를 보내면, 단순히 LLM을 직접 호출하는 것 이상의 작업이 수행됩니다. API는 마인드(mind)의 지식 베이스를 바탕으로 답변의 근거를 마련(grounding)하기 위해 여러 단계를 조율하며, 이를 통해 맥락에 맞는 고품질의 답변을 제공합니다.

일반적인 응답 시간:

시나리오지연 시간
파운데이션 모델 직접 호출 (맥락 없음)1-3초
Minds API (지식 근거 마련 포함)5-12초
Minds API (단순 인사 / RAG 미적용)2-4초

추가로 소요되는 시간은 지식 검색 및 근거 마련(grounding)에 사용되며, 이 과정 덕분에 Minds는 단순 LLM 호출보다 더 정확하고 맥락에 맞는 답변을 제공할 수 있습니다.

요청 처리 과정

POST /api/v1/sparks/{sparkId}/completion를 호출하면 API는 다음 단계를 수행합니다:

1. Authentication & mind loading          ~50ms
2. Knowledge retrieval (RAG)              ~1-3s
   - Semantic search across embeddings
   - Retrieve relevant knowledge chunks
3. Tool orchestration                     ~1-3s
   - Web search (if needed)
   - Knowledge grounding & citations
4. LLM generation                         ~1-3s
   - Same latency as calling the model directly
5. Response formatting & citations         ~50ms

단계 2와 3은 Minds가 단순 API 호출과 차별화되는 핵심 요소입니다. 이 단계를 통해 마인드의 지식 베이스, 웹 검색 결과, 그리고 근거가 확실한 인용구로부터 관련 맥락을 마인드에 제공합니다.

벤치마크 결과

2026년 3월 12일 측정 기준입니다. 각 테스트는 동일한 프롬프트로 3회씩 실행되었습니다. Minds API 호출에는 전체 RAG 파이프라인 및 도구 조율(tool orchestration) 과정이 포함되어 있습니다.

모델별 응답 시간

엔드포인트평균최소최대
Minds API (default)12,166ms10,951ms13,910ms
Minds API (gpt-4o)7,013ms5,900ms8,203ms
Minds API (gpt-4o-mini)6,651ms4,702ms7,975ms
Minds API (gemini-2.5-flash)7,553ms5,170ms11,198ms
Direct OpenAI (gpt-4o)1,461ms1,139ms1,720ms
Direct OpenAI (gpt-4o-mini)1,784ms1,589ms1,925ms
Direct Google (gemini-2.5-flash)1,593ms1,466ms1,701ms

오버헤드 세부 분석

모델Minds API직접 호출오버헤드
gpt-4o-mini6,651ms1,784ms+4,867ms
gpt-4o7,013ms1,461ms+5,551ms
gemini-2.5-flash7,553ms1,593ms+5,960ms

테스트된 모든 모델의 평균 오버헤드는 약 5.5초입니다. 이 오버헤드에는 다음 작업이 포함됩니다:

  • 마인드의 벡터 임베딩에 대한 시맨틱 검색
  • 지식 청크 검색 및 순위 지정
  • 웹 검색 검증 (해당하는 경우)
  • 인용구 매핑 및 답변 근거 마련
  • 도구 조율(Tool orchestration) 파이프라인

오버헤드가 제공하는 가치

추가적인 지연 시간은 지능을 얻기 위한 비용입니다. 단순 LLM 호출은 비즈니스 도메인에 대한 맥락을 전혀 알지 못합니다. Minds는 다음과 같은 가치를 제공합니다:

  1. 지식 근거 마련 (Knowledge grounding): 모델의 학습 데이터에만 의존하지 않고, 마인드의 특정 지식 베이스를 바탕으로 답변합니다.
  2. 자동 인용구 생성: 답변의 바탕이 된 출처를 정확히 파악할 수 있습니다.
  3. 웹 검색 검증: 실시간 웹 데이터와 교차 검증하여 지식을 보완합니다.
  4. 일관된 페르소나: 마인드의 고유한 성격과 커뮤니케이션 스타일을 유지하며 답변합니다.
  5. 사고 패턴: 마인드가 추론하는 방식을 형성하는 심리학적 모델링을 적용합니다.

지연 시간 최적화하기

적절한 모델 선택

상황에 따라 더 빠른 모델을 선택하려면 model 매개변수를 사용하세요:

# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'

모델 속도 순위 (가장 빠른 순):

  1. gpt-4o-mini / gemini-3.6-flash - 속도가 중요한 유스케이스에 가장 적합
  2. gpt-4o / claude-sonnet-4-5 - 속도와 품질의 균형
  3. 기본값 (서버 선택) - 품질에 최적화됨

메시지를 간결하게 유지

대화 기록이 짧을수록 처리 시간이 단축됩니다. messages 배열에는 관련 있는 맥락만 포함하세요.

마인드 예열 (Warm Minds)

일정 기간 비활성 상태였던 마인드에 보내는 첫 번째 요청은 콜드 스타트(cold-start) 영향으로 인해 다소 느릴 수 있습니다. 이후의 요청은 캐시된 임베딩과 예열된 연결 덕분에 더 빠르게 처리됩니다.

스트리밍 (출시 예정)

완성(completion) 엔드포인트에 대한 스트리밍 지원을 준비 중입니다. 이를 통해 전체 답변이 생성되는 동안 첫 번째 토큰을 훨씬 빠르게 전달할 수 있습니다. 대화형 애플리케이션에서 사용자가 체감하는 지연 시간이 크게 단축될 것입니다.

호출 비율 제한 (Rate Limits)

v1 API는 인증된 계정별로 설정 가능한 고정 시간 창 제한(기본값 분당 300개 요청)을 적용합니다. RateLimit-* 헤더를 읽고 429 이후에는 Retry-After를 따르며 동시 요청 수를 제한하세요. 에러 및 제한 사항을 참조하세요.

다음 단계