Minds Team

Latency

Verstehen Sie Response-Latenz, welche Faktoren sie beeinflussen und wie sie sich im Vergleich zum direkten Aufruf von Foundation Models verhält.

Verstehen Sie, wie die Response-Zeiten der Minds API im Vergleich zum direkten Aufruf von Foundation Models abschneiden und welche Faktoren zum Unterschied beitragen.

Übersicht

Wenn Sie eine Nachricht über die Minds API senden, umfasst die Response mehr als nur einen reinen LLM-Aufruf. Die API orchestriert mehrere Schritte, um die Response in der Knowledge Base Ihres Minds zu verankern – für qualitativ hochwertigere, kontextbezogene Antworten.

Typische Response-Zeiten:

SzenarioLatency
Direkter Foundation-Model-Aufruf (kein Kontext)1-3s
Minds API (mit Knowledge Grounding)5-12s
Minds API (einfache Begrüßung / kein RAG)2-4s

Die zusätzliche Zeit wird für Knowledge Retrieval und Grounding aufgewendet – genau das macht Minds-Responses genauer und kontextbezogener als reine LLM-Aufrufe.

Was während eines Requests passiert

Wenn Sie POST /api/v1/sparks/{sparkId}/completion aufrufen, führt die API folgende Schritte aus:

1. Authentifizierung & Mind-Laden            ~50ms
2. Knowledge Retrieval (RAG)                 ~1-3s
   - Semantische Suche über Embeddings
   - Relevante Knowledge Chunks abrufen
3. Tool-Orchestrierung                       ~1-3s
   - Websuche (falls nötig)
   - Knowledge Grounding & Zitationen
4. LLM-Generierung                           ~1-3s
   - Gleiche Latency wie beim direkten Modellaufruf
5. Response-Formatierung & Zitationen        ~50ms

Schritte 2-3 unterscheiden Minds von einem reinen API-Aufruf. Sie versorgen Ihren Mind mit relevantem Kontext aus seiner Knowledge Base, Websuchergebnissen und gegroundeten Zitationen.

Benchmark-Ergebnisse

Gemessen am 12. März 2026. Jeder Test wurde dreimal mit demselben Prompt ausgeführt. Minds-API-Aufrufe umfassen die vollständige RAG-Pipeline und Tool-Orchestrierung.

Response-Zeiten nach Modell

EndpointØMinMax
Minds API (Standard)12.166ms10.951ms13.910ms
Minds API (gpt-4o)7.013ms5.900ms8.203ms
Minds API (gpt-4o-mini)6.651ms4.702ms7.975ms
Minds API (gemini-2.5-flash)7.553ms5.170ms11.198ms
Direct OpenAI (gpt-4o)1.461ms1.139ms1.720ms
Direct OpenAI (gpt-4o-mini)1.784ms1.589ms1.925ms
Direct Google (gemini-2.5-flash)1.593ms1.466ms1.701ms

Overhead-Aufschlüsselung

ModellMinds APIDirectOverhead
gpt-4o-mini6.651ms1.784ms+4.867ms
gpt-4o7.013ms1.461ms+5.551ms
gemini-2.5-flash7.553ms1.593ms+5.960ms

Durchschnittlicher Overhead: ~5,5 Sekunden über alle getesteten Modelle hinweg. Dieser Overhead deckt ab:

  • Semantische Suche über die Vector Embeddings des Minds
  • Abruf und Ranking von Knowledge Chunks
  • Websuch-Validierung (sofern zutreffend)
  • Zitationszuordnung und Response Grounding
  • Tool-Orchestrierungs-Pipeline

Was Ihnen der Overhead bietet

Die zusätzliche Latency ist der Preis für Intelligenz. Ein reiner LLM-Aufruf hat keinen Kontext zu Ihrer Domäne. Minds liefert:

  1. Knowledge Grounding: Responses basieren auf der spezifischen Knowledge Base des Minds – nicht nur auf den Trainingsdaten des Modells
  2. Automatische Zitationen: Sie wissen genau, welche Quellen die Response beeinflusst haben
  3. Websuch-Validierung: Wissen mit aktuellen Webdaten abgleichen
  4. Persona-Konsistenz: Responses bewahren die Persönlichkeit und die Kommunikationsmuster des Minds
  5. Denkmuster: Psychologische Modellierung, die prägt, wie der Mind argumentiert

Latency optimieren

Das richtige Modell wählen

Nutzen Sie den model-Parameter, um bei Bedarf schnellere Modelle auszuwählen:

# Am schnellsten: leichtgewichtige Modelle
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'

Modell-Geschwindigkeitsranking (schnellste zu langsamste):

  1. gpt-4o-mini / gemini-3.6-flash – Beste Wahl für geschwindigkeitskritische Use-Cases
  2. gpt-4o / claude-sonnet-4-5 – Ausgewogen zwischen Geschwindigkeit und Qualität
  3. Standard (server-gewählt) – Auf Qualität optimiert

Nachrichten kurz halten

Kürzere Konversationsverläufe reduzieren die Verarbeitungszeit. Nehmen Sie nur relevanten Kontext in das messages-Array auf.

Warme Minds

Der erste Request an einen Mind nach einer Phase der Inaktivität kann aufgrund von Cold-Start-Effekten geringfügig langsamer sein. Nachfolgende Requests profitieren von gecachten Embeddings und aufgewärmten Verbindungen.

Streaming (folgt in Kürze)

Wir arbeiten an streaming-Support für den Completion-Endpoint, der die ersten Tokens deutlich schneller liefert, während die vollständige Response generiert wird. Das wird die wahrgenommene Latency für interaktive Anwendungen erheblich verbessern.

Rate Limits

Die v1 API erzwingt ein konfigurierbares festes Zeitfenster pro authentifiziertem Konto (standardmäßig 300 Requests pro Minute). Lesen Sie die RateLimit-*-Header, beachten Sie Retry-After nach 429 und begrenzen Sie Parallelität. Siehe Errors & Limits.

Nächste Schritte