---
title: "Latency"
description: "Yanıt gecikmesini, buna neyin katkıda bulunduğunu ve foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını anlayın."
---

# Latency

Minds API yanıt sürelerinin foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını ve farka neyin katkıda bulunduğunu anlayın.

## Genel Bakış

Minds API aracılığıyla bir mesaj gönderdiğinizde, yanıt sadece ham bir LLM çağrısından daha fazlasını içerir. API, yanıtı mind'ınızın bilgi tabanına dayandırmak için birkaç adımı orkestre eder ve daha yüksek kaliteli, bağlamsal yanıtlar sağlar.

**Tipik yanıt süreleri:**

<table>
<thead>
  <tr>
    <th>
      Senaryo
    </th>
    
    <th>
      Latency
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Doğrudan foundation model çağrısı (bağlam yok)
    </td>
    
    <td>
      1-3s
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (bilgi dayandırma ile)
    </td>
    
    <td>
      5-12s
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (basit karşılama / RAG yok)
    </td>
    
    <td>
      2-4s
    </td>
  </tr>
</tbody>
</table>

Ek süre, bilgi getirme ve dayandırma için harcanır; bu da Minds yanıtlarını ham LLM çağrılarından daha doğru ve bağlamsal yapan şeydir.

## Bir İstek Sırasında Ne Olur

`POST /api/v1/minds/{mindId}/completion` çağrısı yaptığınızda, API şu adımları gerçekleştirir:

```text
1. Authentication & mind loading          ~50ms
2. Knowledge retrieval (RAG)              ~1-3s
   - Semantic search across embeddings
   - Retrieve relevant knowledge chunks
3. Tool orchestration                     ~1-3s
   - Web search (if needed)
   - Knowledge grounding & citations
4. LLM generation                         ~1-3s
   - Same latency as calling the model directly
5. Response formatting & citations         ~50ms
```

**Adım 2-3, Minds'ı ham bir API çağrısından ayıran şeydir.** Bunlar, mind'ınıza bilgi tabanından, web arama sonuçlarından ve dayandırılmış alıntılardan ilgili bağlamı sağlar.

## Benchmark Sonuçları

12 Mart 2026'da ölçülmüştür. Her test aynı prompt ile 3 kez çalıştırılmıştır. Minds API çağrıları tam RAG pipeline'ı ve tool orkestrasyonunu içerir.

### Modellere Göre Yanıt Süreleri

<table>
<thead>
  <tr>
    <th>
      Endpoint
    </th>
    
    <th>
      Ort
    </th>
    
    <th>
      Min
    </th>
    
    <th>
      Maks
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds API (varsayılan)
      </strong>
    </td>
    
    <td>
      12.166ms
    </td>
    
    <td>
      10.951ms
    </td>
    
    <td>
      13.910ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o)
      </strong>
    </td>
    
    <td>
      7.013ms
    </td>
    
    <td>
      5.900ms
    </td>
    
    <td>
      8.203ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o-mini)
      </strong>
    </td>
    
    <td>
      6.651ms
    </td>
    
    <td>
      4.702ms
    </td>
    
    <td>
      7.975ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gemini-2.5-flash)
      </strong>
    </td>
    
    <td>
      7.553ms
    </td>
    
    <td>
      5.170ms
    </td>
    
    <td>
      11.198ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o)
    </td>
    
    <td>
      1.461ms
    </td>
    
    <td>
      1.139ms
    </td>
    
    <td>
      1.720ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o-mini)
    </td>
    
    <td>
      1.784ms
    </td>
    
    <td>
      1.589ms
    </td>
    
    <td>
      1.925ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct Google (gemini-2.5-flash)
    </td>
    
    <td>
      1.593ms
    </td>
    
    <td>
      1.466ms
    </td>
    
    <td>
      1.701ms
    </td>
  </tr>
</tbody>
</table>

### Overhead Dökümü

<table>
<thead>
  <tr>
    <th>
      Model
    </th>
    
    <th>
      Minds API
    </th>
    
    <th>
      Direct
    </th>
    
    <th>
      Overhead
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      gpt-4o-mini
    </td>
    
    <td>
      6.651ms
    </td>
    
    <td>
      1.784ms
    </td>
    
    <td>
      +4.867ms
    </td>
  </tr>
  
  <tr>
    <td>
      gpt-4o
    </td>
    
    <td>
      7.013ms
    </td>
    
    <td>
      1.461ms
    </td>
    
    <td>
      +5.551ms
    </td>
  </tr>
  
  <tr>
    <td>
      gemini-2.5-flash
    </td>
    
    <td>
      7.553ms
    </td>
    
    <td>
      1.593ms
    </td>
    
    <td>
      +5.960ms
    </td>
  </tr>
</tbody>
</table>

**Ortalama overhead: ~5,5 saniye** tüm test edilen modellerde. Bu overhead şunları kapsar:

- Mind'ın vector embedding'leri üzerinde semantik arama
- Bilgi chunk'larının alınması ve sıralanması
- Web arama doğrulaması (uygulanabilir olduğunda)
- Alıntı eşleştirme ve yanıt dayandırma
- Tool orkestrasyon pipeline'ı

## Overhead Size Ne Kazandırır

Ek latency, zekanın bedelidir. Ham bir LLM çağrısının alanınız hakkında bağlamı yoktur. Minds şunları sağlar:

1. **Bilgi dayandırma**: Yanıtlar, sadece modelin eğitim verilerine değil, mind'ınızın spesifik bilgi tabanına dayanır
2. **Otomatik alıntılar**: Yanıtı tam olarak hangi kaynakların şekillendirdiğini bilin
3. **Web arama doğrulaması**: Bilgiyi canlı web verileriyle çapraz referanslayın
4. **Persona tutarlılığı**: Yanıtlar mind'ın kişiliğini ve iletişim örüntülerini korur
5. **Düşünme örüntüleri**: Mind'ın nasıl akıl yürüttüğünü şekillendiren psikolojik modelleme

## Latency Optimizasyonu

### Doğru Modeli Seçin

Uygun olduğunda daha hızlı modeller seçmek için `model` parametresini kullanın:

```bash
# En hızlı: hafif modeller
curl -X POST "https://api.getminds.ai/v1/minds/{mindId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'
```

**Model hız sıralaması** (en hızlıdan en yavaşa):

1. `gpt-4o-mini` / `gemini-3.7-flash` - Hız kritik kullanım senaryoları için en iyisi
2. `gpt-4o` / `claude-sonnet-4-5` - Dengeli hız ve kalite
3. Varsayılan (sunucu seçimli) - Kalite için optimize edilmiş

### Mesajları Kısa Tutun

Daha kısa konuşma geçmişleri işlem süresini azaltır. Yalnızca ilgili bağlamı `messages` dizisine dahil edin.

### Mind'ları Sıcak Tutun

Bir süre hareketsizlikten sonra bir mind'a yapılan ilk istek, cold-start etkileri nedeniyle biraz daha yavaş olabilir. Sonraki istekler, önbelleğe alınmış embedding'ler ve ısınmış bağlantılardan yararlanır.

## Streaming (Yakında)

Completion endpoint'i için streaming desteği üzerinde çalışıyoruz; bu, tam yanıt oluşturulurken ilk token'ları çok daha hızlı teslim edecek. Bu, interaktif uygulamalar için algılanan latency'yi önemli ölçüde iyileştirecektir.

## Rate Limit'ler

v1 API kimliği doğrulanmış hesap başına yapılandırılabilir sabit pencere sınırı uygular (varsayılan dakikada 300 istek). `RateLimit-*` başlıklarını okuyun, `429` sonrasında `Retry-After` değerine uyun ve eşzamanlılığı sınırlayın. [Hatalar ve Limitler](/docs/api/errors) bölümüne bakın.

## Sonraki Adımlar

- [Chat API](/docs/api/chat) - Mesaj gönderin ve yanıt alın
- [Knowledge API](/docs/api/knowledge) - Mind'ınızın bilgi tabanını yönetin
- [API Overview](/docs/api/overview) - Tam endpoint referansı
