Minds Team

Latency

Yanıt gecikmesini, buna neyin katkıda bulunduğunu ve foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını anlayın.

Minds API yanıt sürelerinin foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını ve farka neyin katkıda bulunduğunu anlayın.

Genel Bakış

Minds API aracılığıyla bir mesaj gönderdiğinizde, yanıt sadece ham bir LLM çağrısından daha fazlasını içerir. API, yanıtı mind'ınızın bilgi tabanına dayandırmak için birkaç adımı orkestre eder ve daha yüksek kaliteli, bağlamsal yanıtlar sağlar.

Tipik yanıt süreleri:

SenaryoLatency
Doğrudan foundation model çağrısı (bağlam yok)1-3s
Minds API (bilgi dayandırma ile)5-12s
Minds API (basit karşılama / RAG yok)2-4s

Ek süre, bilgi getirme ve dayandırma için harcanır; bu da Minds yanıtlarını ham LLM çağrılarından daha doğru ve bağlamsal yapan şeydir.

Bir İstek Sırasında Ne Olur

POST /api/v1/sparks/{sparkId}/completion çağrısı yaptığınızda, API şu adımları gerçekleştirir:

1. Authentication & mind loading          ~50ms
2. Knowledge retrieval (RAG)              ~1-3s
   - Semantic search across embeddings
   - Retrieve relevant knowledge chunks
3. Tool orchestration                     ~1-3s
   - Web search (if needed)
   - Knowledge grounding & citations
4. LLM generation                         ~1-3s
   - Same latency as calling the model directly
5. Response formatting & citations         ~50ms

Adım 2-3, Minds'ı ham bir API çağrısından ayıran şeydir. Bunlar, mind'ınıza bilgi tabanından, web arama sonuçlarından ve dayandırılmış alıntılardan ilgili bağlamı sağlar.

Benchmark Sonuçları

12 Mart 2026'da ölçülmüştür. Her test aynı prompt ile 3 kez çalıştırılmıştır. Minds API çağrıları tam RAG pipeline'ı ve tool orkestrasyonunu içerir.

Modellere Göre Yanıt Süreleri

EndpointOrtMinMaks
Minds API (varsayılan)12.166ms10.951ms13.910ms
Minds API (gpt-4o)7.013ms5.900ms8.203ms
Minds API (gpt-4o-mini)6.651ms4.702ms7.975ms
Minds API (gemini-2.5-flash)7.553ms5.170ms11.198ms
Direct OpenAI (gpt-4o)1.461ms1.139ms1.720ms
Direct OpenAI (gpt-4o-mini)1.784ms1.589ms1.925ms
Direct Google (gemini-2.5-flash)1.593ms1.466ms1.701ms

Overhead Dökümü

ModelMinds APIDirectOverhead
gpt-4o-mini6.651ms1.784ms+4.867ms
gpt-4o7.013ms1.461ms+5.551ms
gemini-2.5-flash7.553ms1.593ms+5.960ms

Ortalama overhead: ~5,5 saniye tüm test edilen modellerde. Bu overhead şunları kapsar:

  • Mind'ın vector embedding'leri üzerinde semantik arama
  • Bilgi chunk'larının alınması ve sıralanması
  • Web arama doğrulaması (uygulanabilir olduğunda)
  • Alıntı eşleştirme ve yanıt dayandırma
  • Tool orkestrasyon pipeline'ı

Overhead Size Ne Kazandırır

Ek latency, zekanın bedelidir. Ham bir LLM çağrısının alanınız hakkında bağlamı yoktur. Minds şunları sağlar:

  1. Bilgi dayandırma: Yanıtlar, sadece modelin eğitim verilerine değil, mind'ınızın spesifik bilgi tabanına dayanır
  2. Otomatik alıntılar: Yanıtı tam olarak hangi kaynakların şekillendirdiğini bilin
  3. Web arama doğrulaması: Bilgiyi canlı web verileriyle çapraz referanslayın
  4. Persona tutarlılığı: Yanıtlar mind'ın kişiliğini ve iletişim örüntülerini korur
  5. Düşünme örüntüleri: Mind'ın nasıl akıl yürüttüğünü şekillendiren psikolojik modelleme

Latency Optimizasyonu

Doğru Modeli Seçin

Uygun olduğunda daha hızlı modeller seçmek için model parametresini kullanın:

# En hızlı: hafif modeller
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'

Model hız sıralaması (en hızlıdan en yavaşa):

  1. gpt-4o-mini / gemini-3.6-flash - Hız kritik kullanım senaryoları için en iyisi
  2. gpt-4o / claude-sonnet-4-5 - Dengeli hız ve kalite
  3. Varsayılan (sunucu seçimli) - Kalite için optimize edilmiş

Mesajları Kısa Tutun

Daha kısa konuşma geçmişleri işlem süresini azaltır. Yalnızca ilgili bağlamı messages dizisine dahil edin.

Mind'ları Sıcak Tutun

Bir süre hareketsizlikten sonra bir mind'a yapılan ilk istek, cold-start etkileri nedeniyle biraz daha yavaş olabilir. Sonraki istekler, önbelleğe alınmış embedding'ler ve ısınmış bağlantılardan yararlanır.

Streaming (Yakında)

Completion endpoint'i için streaming desteği üzerinde çalışıyoruz; bu, tam yanıt oluşturulurken ilk token'ları çok daha hızlı teslim edecek. Bu, interaktif uygulamalar için algılanan latency'yi önemli ölçüde iyileştirecektir.

Rate Limit'ler

v1 API kimliği doğrulanmış hesap başına yapılandırılabilir sabit pencere sınırı uygular (varsayılan dakikada 300 istek). RateLimit-* başlıklarını okuyun, 429 sonrasında Retry-After değerine uyun ve eşzamanlılığı sınırlayın. Hatalar ve Limitler bölümüne bakın.

Sonraki Adımlar