Latencia
Comprende la latencia de respuesta, qué factores contribuyen a ella y cómo se compara con llamar directamente a los foundation models.
Comprende cómo se comparan los tiempos de respuesta de la API de Minds con llamar directamente a los foundation models, y qué contribuye a la diferencia.
Visión general
Cuando envías un mensaje a través de la API de Minds, la respuesta incluye mucho más que una simple llamada a un LLM. La API orquesta varios pasos para fundamentar la respuesta en el knowledge base de tu mind, proporcionando respuestas contextuales de mayor calidad.
Tiempos de respuesta típicos:
| Escenario | Latencia |
|---|---|
| Llamada directa al foundation model (sin contexto) | 1-3 s |
| API de Minds (con knowledge grounding) | 5-12 s |
| API de Minds (saludo simple / sin RAG) | 2-4 s |
El tiempo adicional se dedica a la recuperación de knowledge y al grounding, que es lo que hace que las respuestas de Minds sean más precisas y contextuales que las llamadas directas a un LLM.
Qué ocurre durante una solicitud
Cuando llamas a POST /api/v1/sparks/{sparkId}/completion, la API realiza estos pasos:
1. Autenticación y carga del mind ~50ms
2. Recuperación de knowledge (RAG) ~1-3s
- Búsqueda semántica en embeddings
- Recuperación de chunks de knowledge relevantes
3. Orquestación de herramientas ~1-3s
- Web search (si es necesario)
- Knowledge grounding y citaciones
4. Generación del LLM ~1-3s
- Misma latencia que llamar al modelo directamente
5. Formato de respuesta y citaciones ~50ms
Los pasos 2-3 son los que diferencian a Minds de una llamada directa a la API. Proporcionan a tu mind contexto relevante de su knowledge base, resultados de búsqueda web y citaciones fundamentadas.
Resultados del benchmark
Medido el 12 de marzo de 2026. Cada test se ejecutó 3 veces con el mismo prompt. Las llamadas a la API de Minds incluyen el pipeline RAG completo y la orquestación de herramientas.
Tiempos de respuesta por modelo
| Endpoint | Avg | Min | Max |
|---|---|---|---|
| Minds API (default) | 12,166ms | 10,951ms | 13,910ms |
| Minds API (gpt-4o) | 7,013ms | 5,900ms | 8,203ms |
| Minds API (gpt-4o-mini) | 6,651ms | 4,702ms | 7,975ms |
| Minds API (gemini-2.5-flash) | 7,553ms | 5,170ms | 11,198ms |
| Direct OpenAI (gpt-4o) | 1,461ms | 1,139ms | 1,720ms |
| Direct OpenAI (gpt-4o-mini) | 1,784ms | 1,589ms | 1,925ms |
| Direct Google (gemini-2.5-flash) | 1,593ms | 1,466ms | 1,701ms |
Desglose del overhead
| Modelo | Minds API | Directo | Overhead |
|---|---|---|---|
| gpt-4o-mini | 6,651ms | 1,784ms | +4,867ms |
| gpt-4o | 7,013ms | 1,461ms | +5,551ms |
| gemini-2.5-flash | 7,553ms | 1,593ms | +5,960ms |
Overhead medio: ~5,5 segundos en todos los modelos probados. Este overhead cubre:
- Búsqueda semántica en los vector embeddings del mind
- Recuperación y ranking de chunks de knowledge
- Validación mediante web search (cuando procede)
- Mapeo de citaciones y grounding de la respuesta
- Pipeline de orquestación de herramientas
Qué te aporta ese overhead
La latencia adicional es el coste de la inteligencia. Una llamada directa a un LLM no tiene contexto sobre tu dominio. Minds proporciona:
- Knowledge grounding: las respuestas se basan en el knowledge base específico de tu mind, no solo en los datos de entrenamiento del modelo
- Citaciones automáticas: sabes exactamente qué fuentes han alimentado la respuesta
- Validación mediante web search: contrasta el knowledge con datos web en vivo
- Consistencia de persona: las respuestas mantienen la personalidad y los patrones de comunicación del mind
- Patrones de pensamiento: modelado psicológico que da forma a cómo razona el mind
Optimizar la latencia
Elige el modelo adecuado
Usa el parámetro model para seleccionar modelos más rápidos cuando sea apropiado:
# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
-H "Authorization: Bearer minds_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Quick question"}],
"model": "gpt-4o-mini"
}'
Ranking de velocidad de los modelos (de más rápido a más lento):
gpt-4o-mini/gemini-3.6-flash- Ideal para casos críticos en velocidadgpt-4o/claude-sonnet-4-5- Equilibrio entre velocidad y calidad- Default (seleccionado por el servidor) - Optimizado para calidad
Mantén los mensajes concisos
Los historiales de conversación más cortos reducen el tiempo de procesamiento. Incluye solo el contexto relevante en el array messages.
Minds "calientes"
La primera solicitud a un mind tras un periodo de inactividad puede ser ligeramente más lenta por efectos de cold-start. Las solicitudes posteriores se benefician de embeddings cacheados y conexiones ya calentadas.
Streaming (próximamente)
Estamos trabajando en soporte de streaming para el endpoint de completion, que entregará los primeros tokens mucho más rápido mientras se genera la respuesta completa. Esto mejorará significativamente la latencia percibida en aplicaciones interactivas.
Rate limits
La API v1 aplica una ventana fija configurable por cuenta autenticada (300 solicitudes por minuto de forma predeterminada). Lee los headers RateLimit-*, respeta Retry-After tras un 429 y limita la concurrencia. Consulta Errores y límites.
Siguientes pasos
- Chat API - Enviar mensajes y recibir respuestas
- Knowledge API - Gestionar el knowledge base de tu spark
- Visión general de la API - Referencia completa de endpoints