---
title: "Latency"
description: "Verstehen Sie Response-Latenz, welche Faktoren sie beeinflussen und wie sie sich im Vergleich zum direkten Aufruf von Foundation Models verhält."
---

# Latency

Verstehen Sie, wie die Response-Zeiten der Minds API im Vergleich zum direkten Aufruf von Foundation Models abschneiden und welche Faktoren zum Unterschied beitragen.

## Übersicht

Wenn Sie eine Nachricht über die Minds API senden, umfasst die Response mehr als nur einen reinen LLM-Aufruf. Die API orchestriert mehrere Schritte, um die Response in der Knowledge Base Ihres Minds zu verankern – für qualitativ hochwertigere, kontextbezogene Antworten.

**Typische Response-Zeiten:**

<table>
<thead>
  <tr>
    <th>
      Szenario
    </th>
    
    <th>
      Latency
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Direkter Foundation-Model-Aufruf (kein Kontext)
    </td>
    
    <td>
      1-3s
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (mit Knowledge Grounding)
    </td>
    
    <td>
      5-12s
    </td>
  </tr>
  
  <tr>
    <td>
      Minds API (einfache Begrüßung / kein RAG)
    </td>
    
    <td>
      2-4s
    </td>
  </tr>
</tbody>
</table>

Die zusätzliche Zeit wird für Knowledge Retrieval und Grounding aufgewendet – genau das macht Minds-Responses genauer und kontextbezogener als reine LLM-Aufrufe.

## Was während eines Requests passiert

Wenn Sie `POST /api/v1/minds/{mindId}/completion` aufrufen, führt die API folgende Schritte aus:

```text
1. Authentifizierung & Mind-Laden            ~50ms
2. Knowledge Retrieval (RAG)                 ~1-3s
   - Semantische Suche über Embeddings
   - Relevante Knowledge Chunks abrufen
3. Tool-Orchestrierung                       ~1-3s
   - Websuche (falls nötig)
   - Knowledge Grounding & Zitationen
4. LLM-Generierung                           ~1-3s
   - Gleiche Latency wie beim direkten Modellaufruf
5. Response-Formatierung & Zitationen        ~50ms
```

**Schritte 2-3 unterscheiden Minds von einem reinen API-Aufruf.** Sie versorgen Ihren Mind mit relevantem Kontext aus seiner Knowledge Base, Websuchergebnissen und gegroundeten Zitationen.

## Benchmark-Ergebnisse

Gemessen am 12. März 2026. Jeder Test wurde dreimal mit demselben Prompt ausgeführt. Minds-API-Aufrufe umfassen die vollständige RAG-Pipeline und Tool-Orchestrierung.

### Response-Zeiten nach Modell

<table>
<thead>
  <tr>
    <th>
      Endpoint
    </th>
    
    <th>
      Ø
    </th>
    
    <th>
      Min
    </th>
    
    <th>
      Max
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds API (Standard)
      </strong>
    </td>
    
    <td>
      12.166ms
    </td>
    
    <td>
      10.951ms
    </td>
    
    <td>
      13.910ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o)
      </strong>
    </td>
    
    <td>
      7.013ms
    </td>
    
    <td>
      5.900ms
    </td>
    
    <td>
      8.203ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gpt-4o-mini)
      </strong>
    </td>
    
    <td>
      6.651ms
    </td>
    
    <td>
      4.702ms
    </td>
    
    <td>
      7.975ms
    </td>
  </tr>
  
  <tr>
    <td>
      <strong>
        Minds API (gemini-2.5-flash)
      </strong>
    </td>
    
    <td>
      7.553ms
    </td>
    
    <td>
      5.170ms
    </td>
    
    <td>
      11.198ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o)
    </td>
    
    <td>
      1.461ms
    </td>
    
    <td>
      1.139ms
    </td>
    
    <td>
      1.720ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct OpenAI (gpt-4o-mini)
    </td>
    
    <td>
      1.784ms
    </td>
    
    <td>
      1.589ms
    </td>
    
    <td>
      1.925ms
    </td>
  </tr>
  
  <tr>
    <td>
      Direct Google (gemini-2.5-flash)
    </td>
    
    <td>
      1.593ms
    </td>
    
    <td>
      1.466ms
    </td>
    
    <td>
      1.701ms
    </td>
  </tr>
</tbody>
</table>

### Overhead-Aufschlüsselung

<table>
<thead>
  <tr>
    <th>
      Modell
    </th>
    
    <th>
      Minds API
    </th>
    
    <th>
      Direct
    </th>
    
    <th>
      Overhead
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      gpt-4o-mini
    </td>
    
    <td>
      6.651ms
    </td>
    
    <td>
      1.784ms
    </td>
    
    <td>
      +4.867ms
    </td>
  </tr>
  
  <tr>
    <td>
      gpt-4o
    </td>
    
    <td>
      7.013ms
    </td>
    
    <td>
      1.461ms
    </td>
    
    <td>
      +5.551ms
    </td>
  </tr>
  
  <tr>
    <td>
      gemini-2.5-flash
    </td>
    
    <td>
      7.553ms
    </td>
    
    <td>
      1.593ms
    </td>
    
    <td>
      +5.960ms
    </td>
  </tr>
</tbody>
</table>

**Durchschnittlicher Overhead: ~5,5 Sekunden** über alle getesteten Modelle hinweg. Dieser Overhead deckt ab:

- Semantische Suche über die Vector Embeddings des Minds
- Abruf und Ranking von Knowledge Chunks
- Websuch-Validierung (sofern zutreffend)
- Zitationszuordnung und Response Grounding
- Tool-Orchestrierungs-Pipeline

## Was Ihnen der Overhead bietet

Die zusätzliche Latency ist der Preis für Intelligenz. Ein reiner LLM-Aufruf hat keinen Kontext zu Ihrer Domäne. Minds liefert:

1. **Knowledge Grounding**: Responses basieren auf der spezifischen Knowledge Base des Minds – nicht nur auf den Trainingsdaten des Modells
2. **Automatische Zitationen**: Sie wissen genau, welche Quellen die Response beeinflusst haben
3. **Websuch-Validierung**: Wissen mit aktuellen Webdaten abgleichen
4. **Persona-Konsistenz**: Responses bewahren die Persönlichkeit und die Kommunikationsmuster des Minds
5. **Denkmuster**: Psychologische Modellierung, die prägt, wie der Mind argumentiert

## Latency optimieren

### Das richtige Modell wählen

Nutzen Sie den `model`-Parameter, um bei Bedarf schnellere Modelle auszuwählen:

```bash
# Am schnellsten: leichtgewichtige Modelle
curl -X POST "https://api.getminds.ai/v1/minds/{mindId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'
```

**Modell-Geschwindigkeitsranking** (schnellste zu langsamste):

1. `gpt-4o-mini` / `gemini-3.7-flash` – Beste Wahl für geschwindigkeitskritische Use-Cases
2. `gpt-4o` / `claude-sonnet-4-5` – Ausgewogen zwischen Geschwindigkeit und Qualität
3. Standard (server-gewählt) – Auf Qualität optimiert

### Nachrichten kurz halten

Kürzere Konversationsverläufe reduzieren die Verarbeitungszeit. Nehmen Sie nur relevanten Kontext in das `messages`-Array auf.

### Warme Minds

Der erste Request an einen Mind nach einer Phase der Inaktivität kann aufgrund von Cold-Start-Effekten geringfügig langsamer sein. Nachfolgende Requests profitieren von gecachten Embeddings und aufgewärmten Verbindungen.

## Streaming (folgt in Kürze)

Wir arbeiten an streaming-Support für den Completion-Endpoint, der die ersten Tokens deutlich schneller liefert, während die vollständige Response generiert wird. Das wird die wahrgenommene Latency für interaktive Anwendungen erheblich verbessern.

## Rate Limits

Die v1 API erzwingt ein konfigurierbares festes Zeitfenster pro authentifiziertem Konto (standardmäßig 300 Requests pro Minute). Lesen Sie die `RateLimit-*`-Header, beachten Sie `Retry-After` nach `429` und begrenzen Sie Parallelität. Siehe [Errors & Limits](/docs/api/errors).

## Nächste Schritte

- [Chat API](/docs/api/chat) – Nachrichten senden und Antworten erhalten
- [Knowledge API](/docs/api/knowledge) – Die Knowledge Base Ihres Minds verwalten
- [API-Übersicht](/docs/api/overview) – Vollständige Endpoint-Referenz
