Latence
Comprendre la latence des réponses, ce qui y contribue et comment elle se compare à un appel direct aux foundation models.
Comprenez comment les temps de réponse de l'API Minds se comparent à un appel direct aux foundation models, et ce qui explique la différence.
Vue d'ensemble
Lorsque vous envoyez un message via l'API Minds, la réponse inclut bien plus qu'un simple appel LLM brut. L'API orchestre plusieurs étapes pour ancrer la réponse dans la base de connaissances de votre mind, fournissant ainsi des réponses contextuelles de meilleure qualité.
Temps de réponse typiques :
| Scénario | Latence |
|---|---|
| Appel direct à un foundation model (sans contexte) | 1-3s |
| API Minds (avec ancrage dans la connaissance) | 5-12s |
| API Minds (simple salutation / sans RAG) | 2-4s |
Le temps supplémentaire est consacré à la récupération et à l'ancrage des connaissances, ce qui rend les réponses de Minds plus précises et contextuelles que les appels LLM bruts.
Que se passe-t-il durant une requête
Lorsque vous appelez POST /api/v1/sparks/{sparkId}/completion, l'API effectue les étapes suivantes :
1. Authentication & mind loading ~50ms
2. Knowledge retrieval (RAG) ~1-3s
- Semantic search across embeddings
- Retrieve relevant knowledge chunks
3. Tool orchestration ~1-3s
- Web search (if needed)
- Knowledge grounding & citations
4. LLM generation ~1-3s
- Same latency as calling the model directly
5. Response formatting & citations ~50ms
Les étapes 2-3 sont ce qui différencie Minds d'un appel API brut. Elles fournissent à votre mind le contexte pertinent depuis sa base de connaissances, les résultats de recherche web et les citations ancrées.
Résultats de benchmark
Mesuré le 12 mars 2026. Chaque test a été exécuté 3 fois avec le même prompt. Les appels à l'API Minds incluent la pipeline RAG complète et l'orchestration des outils.
Temps de réponse par modèle
| Endpoint | Moy | Min | Max |
|---|---|---|---|
| Minds API (default) | 12 166 ms | 10 951 ms | 13 910 ms |
| Minds API (gpt-4o) | 7 013 ms | 5 900 ms | 8 203 ms |
| Minds API (gpt-4o-mini) | 6 651 ms | 4 702 ms | 7 975 ms |
| Minds API (gemini-2.5-flash) | 7 553 ms | 5 170 ms | 11 198 ms |
| Direct OpenAI (gpt-4o) | 1 461 ms | 1 139 ms | 1 720 ms |
| Direct OpenAI (gpt-4o-mini) | 1 784 ms | 1 589 ms | 1 925 ms |
| Direct Google (gemini-2.5-flash) | 1 593 ms | 1 466 ms | 1 701 ms |
Décomposition du surcoût
| Modèle | Minds API | Direct | Surcoût |
|---|---|---|---|
| gpt-4o-mini | 6 651 ms | 1 784 ms | +4 867 ms |
| gpt-4o | 7 013 ms | 1 461 ms | +5 551 ms |
| gemini-2.5-flash | 7 553 ms | 1 593 ms | +5 960 ms |
Surcoût moyen : ~5,5 secondes sur l'ensemble des modèles testés. Ce surcoût couvre :
- La recherche sémantique dans les embeddings vectoriels du mind
- La récupération et le classement des blocs de connaissances
- La validation par recherche web (le cas échéant)
- La cartographie des citations et l'ancrage des réponses
- La pipeline d'orchestration des outils
Ce que le surcoût vous apporte
La latence supplémentaire est le coût de l'intelligence. Un appel LLM brut n'a aucun contexte sur votre domaine. Minds fournit :
- Ancrage dans la connaissance : Les réponses sont basées sur la base de connaissances spécifique du mind, pas uniquement sur les données d'entraînement du modèle
- Citations automatiques : Savoir exactement quelles sources ont informé la réponse
- Validation par recherche web : Recoupement des connaissances avec les données web en direct
- Cohérence de persona : Les réponses conservent la personnalité et les schémas de communication du mind
- Patterns de raisonnement : Modélisation psychologique qui façonne la manière dont le mind raisonne
Optimiser la latence
Choisissez le bon modèle
Utilisez le paramètre model pour sélectionner des modèles plus rapides lorsque c'est approprié :
# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
-H "Authorization: Bearer minds_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Quick question"}],
"model": "gpt-4o-mini"
}'
Classement de la vitesse des modèles (du plus rapide au plus lent) :
gpt-4o-mini/gemini-3.6-flash— Meilleur pour les cas d'usage où la vitesse est critiquegpt-4o/claude-sonnet-4-5— Équilibre entre vitesse et qualité- Défaut (sélectionné par le serveur) — Optimisé pour la qualité
Gardez les messages concis
Des historiques de conversation plus courts réduisent le temps de traitement. N'incluez que le contexte pertinent dans le tableau messages.
Échauffez les minds
La première requête à un mind après une période d'inactivité peut être légèrement plus lente en raison d'effets de démarrage à froid. Les requêtes suivantes bénéficient des embeddings mis en cache et des connexions chauffées.
Streaming (bientôt disponible)
Nous travaillons sur la prise en charge du streaming pour l'endpoint de completion, qui délivrera les premiers tokens beaucoup plus rapidement pendant que la réponse complète se génère. Cela améliorera considérablement la latence perçue pour les applications interactives.
Rate limits
L'API v1 applique une fenêtre fixe configurable par compte authentifié (300 requêtes par minute par défaut). Lisez les en-têtes RateLimit-*, respectez Retry-After après un 429 et limitez la concurrence. Voir Errors & Limits.
Étapes suivantes
- Chat API — Envoyer des messages et recevoir des réponses
- Knowledge API — Gérer la base de connaissances de votre spark
- API Overview — Référence complète des endpoints