Latency
Yanıt gecikmesini, buna neyin katkıda bulunduğunu ve foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını anlayın.
Minds API yanıt sürelerinin foundation modelleri doğrudan çağırmakla nasıl karşılaştırıldığını ve farka neyin katkıda bulunduğunu anlayın.
Genel Bakış
Minds API aracılığıyla bir mesaj gönderdiğinizde, yanıt sadece ham bir LLM çağrısından daha fazlasını içerir. API, yanıtı mind'ınızın bilgi tabanına dayandırmak için birkaç adımı orkestre eder ve daha yüksek kaliteli, bağlamsal yanıtlar sağlar.
Tipik yanıt süreleri:
| Senaryo | Latency |
|---|---|
| Doğrudan foundation model çağrısı (bağlam yok) | 1-3s |
| Minds API (bilgi dayandırma ile) | 5-12s |
| Minds API (basit karşılama / RAG yok) | 2-4s |
Ek süre, bilgi getirme ve dayandırma için harcanır; bu da Minds yanıtlarını ham LLM çağrılarından daha doğru ve bağlamsal yapan şeydir.
Bir İstek Sırasında Ne Olur
POST /api/v1/sparks/{sparkId}/completion çağrısı yaptığınızda, API şu adımları gerçekleştirir:
1. Authentication & mind loading ~50ms
2. Knowledge retrieval (RAG) ~1-3s
- Semantic search across embeddings
- Retrieve relevant knowledge chunks
3. Tool orchestration ~1-3s
- Web search (if needed)
- Knowledge grounding & citations
4. LLM generation ~1-3s
- Same latency as calling the model directly
5. Response formatting & citations ~50ms
Adım 2-3, Minds'ı ham bir API çağrısından ayıran şeydir. Bunlar, mind'ınıza bilgi tabanından, web arama sonuçlarından ve dayandırılmış alıntılardan ilgili bağlamı sağlar.
Benchmark Sonuçları
12 Mart 2026'da ölçülmüştür. Her test aynı prompt ile 3 kez çalıştırılmıştır. Minds API çağrıları tam RAG pipeline'ı ve tool orkestrasyonunu içerir.
Modellere Göre Yanıt Süreleri
| Endpoint | Ort | Min | Maks |
|---|---|---|---|
| Minds API (varsayılan) | 12.166ms | 10.951ms | 13.910ms |
| Minds API (gpt-4o) | 7.013ms | 5.900ms | 8.203ms |
| Minds API (gpt-4o-mini) | 6.651ms | 4.702ms | 7.975ms |
| Minds API (gemini-2.5-flash) | 7.553ms | 5.170ms | 11.198ms |
| Direct OpenAI (gpt-4o) | 1.461ms | 1.139ms | 1.720ms |
| Direct OpenAI (gpt-4o-mini) | 1.784ms | 1.589ms | 1.925ms |
| Direct Google (gemini-2.5-flash) | 1.593ms | 1.466ms | 1.701ms |
Overhead Dökümü
| Model | Minds API | Direct | Overhead |
|---|---|---|---|
| gpt-4o-mini | 6.651ms | 1.784ms | +4.867ms |
| gpt-4o | 7.013ms | 1.461ms | +5.551ms |
| gemini-2.5-flash | 7.553ms | 1.593ms | +5.960ms |
Ortalama overhead: ~5,5 saniye tüm test edilen modellerde. Bu overhead şunları kapsar:
- Mind'ın vector embedding'leri üzerinde semantik arama
- Bilgi chunk'larının alınması ve sıralanması
- Web arama doğrulaması (uygulanabilir olduğunda)
- Alıntı eşleştirme ve yanıt dayandırma
- Tool orkestrasyon pipeline'ı
Overhead Size Ne Kazandırır
Ek latency, zekanın bedelidir. Ham bir LLM çağrısının alanınız hakkında bağlamı yoktur. Minds şunları sağlar:
- Bilgi dayandırma: Yanıtlar, sadece modelin eğitim verilerine değil, mind'ınızın spesifik bilgi tabanına dayanır
- Otomatik alıntılar: Yanıtı tam olarak hangi kaynakların şekillendirdiğini bilin
- Web arama doğrulaması: Bilgiyi canlı web verileriyle çapraz referanslayın
- Persona tutarlılığı: Yanıtlar mind'ın kişiliğini ve iletişim örüntülerini korur
- Düşünme örüntüleri: Mind'ın nasıl akıl yürüttüğünü şekillendiren psikolojik modelleme
Latency Optimizasyonu
Doğru Modeli Seçin
Uygun olduğunda daha hızlı modeller seçmek için model parametresini kullanın:
# En hızlı: hafif modeller
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
-H "Authorization: Bearer minds_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Quick question"}],
"model": "gpt-4o-mini"
}'
Model hız sıralaması (en hızlıdan en yavaşa):
gpt-4o-mini/gemini-3.6-flash- Hız kritik kullanım senaryoları için en iyisigpt-4o/claude-sonnet-4-5- Dengeli hız ve kalite- Varsayılan (sunucu seçimli) - Kalite için optimize edilmiş
Mesajları Kısa Tutun
Daha kısa konuşma geçmişleri işlem süresini azaltır. Yalnızca ilgili bağlamı messages dizisine dahil edin.
Mind'ları Sıcak Tutun
Bir süre hareketsizlikten sonra bir mind'a yapılan ilk istek, cold-start etkileri nedeniyle biraz daha yavaş olabilir. Sonraki istekler, önbelleğe alınmış embedding'ler ve ısınmış bağlantılardan yararlanır.
Streaming (Yakında)
Completion endpoint'i için streaming desteği üzerinde çalışıyoruz; bu, tam yanıt oluşturulurken ilk token'ları çok daha hızlı teslim edecek. Bu, interaktif uygulamalar için algılanan latency'yi önemli ölçüde iyileştirecektir.
Rate Limit'ler
v1 API kimliği doğrulanmış hesap başına yapılandırılabilir sabit pencere sınırı uygular (varsayılan dakikada 300 istek). RateLimit-* başlıklarını okuyun, 429 sonrasında Retry-After değerine uyun ve eşzamanlılığı sınırlayın. Hatalar ve Limitler bölümüne bakın.
Sonraki Adımlar
- Chat API - Mesaj gönderin ve yanıt alın
- Knowledge API - Spark'ınızın bilgi tabanını yönetin
- API Overview - Tam endpoint referansı