Minds Team

Latencia

Comprende la latencia de respuesta, qué factores contribuyen a ella y cómo se compara con llamar directamente a los foundation models.

Comprende cómo se comparan los tiempos de respuesta de la API de Minds con llamar directamente a los foundation models, y qué contribuye a la diferencia.

Visión general

Cuando envías un mensaje a través de la API de Minds, la respuesta incluye mucho más que una simple llamada a un LLM. La API orquesta varios pasos para fundamentar la respuesta en el knowledge base de tu mind, proporcionando respuestas contextuales de mayor calidad.

Tiempos de respuesta típicos:

EscenarioLatencia
Llamada directa al foundation model (sin contexto)1-3 s
API de Minds (con knowledge grounding)5-12 s
API de Minds (saludo simple / sin RAG)2-4 s

El tiempo adicional se dedica a la recuperación de knowledge y al grounding, que es lo que hace que las respuestas de Minds sean más precisas y contextuales que las llamadas directas a un LLM.

Qué ocurre durante una solicitud

Cuando llamas a POST /api/v1/sparks/{sparkId}/completion, la API realiza estos pasos:

1. Autenticación y carga del mind            ~50ms
2. Recuperación de knowledge (RAG)           ~1-3s
   - Búsqueda semántica en embeddings
   - Recuperación de chunks de knowledge relevantes
3. Orquestación de herramientas              ~1-3s
   - Web search (si es necesario)
   - Knowledge grounding y citaciones
4. Generación del LLM                        ~1-3s
   - Misma latencia que llamar al modelo directamente
5. Formato de respuesta y citaciones         ~50ms

Los pasos 2-3 son los que diferencian a Minds de una llamada directa a la API. Proporcionan a tu mind contexto relevante de su knowledge base, resultados de búsqueda web y citaciones fundamentadas.

Resultados del benchmark

Medido el 12 de marzo de 2026. Cada test se ejecutó 3 veces con el mismo prompt. Las llamadas a la API de Minds incluyen el pipeline RAG completo y la orquestación de herramientas.

Tiempos de respuesta por modelo

EndpointAvgMinMax
Minds API (default)12,166ms10,951ms13,910ms
Minds API (gpt-4o)7,013ms5,900ms8,203ms
Minds API (gpt-4o-mini)6,651ms4,702ms7,975ms
Minds API (gemini-2.5-flash)7,553ms5,170ms11,198ms
Direct OpenAI (gpt-4o)1,461ms1,139ms1,720ms
Direct OpenAI (gpt-4o-mini)1,784ms1,589ms1,925ms
Direct Google (gemini-2.5-flash)1,593ms1,466ms1,701ms

Desglose del overhead

ModeloMinds APIDirectoOverhead
gpt-4o-mini6,651ms1,784ms+4,867ms
gpt-4o7,013ms1,461ms+5,551ms
gemini-2.5-flash7,553ms1,593ms+5,960ms

Overhead medio: ~5,5 segundos en todos los modelos probados. Este overhead cubre:

  • Búsqueda semántica en los vector embeddings del mind
  • Recuperación y ranking de chunks de knowledge
  • Validación mediante web search (cuando procede)
  • Mapeo de citaciones y grounding de la respuesta
  • Pipeline de orquestación de herramientas

Qué te aporta ese overhead

La latencia adicional es el coste de la inteligencia. Una llamada directa a un LLM no tiene contexto sobre tu dominio. Minds proporciona:

  1. Knowledge grounding: las respuestas se basan en el knowledge base específico de tu mind, no solo en los datos de entrenamiento del modelo
  2. Citaciones automáticas: sabes exactamente qué fuentes han alimentado la respuesta
  3. Validación mediante web search: contrasta el knowledge con datos web en vivo
  4. Consistencia de persona: las respuestas mantienen la personalidad y los patrones de comunicación del mind
  5. Patrones de pensamiento: modelado psicológico que da forma a cómo razona el mind

Optimizar la latencia

Elige el modelo adecuado

Usa el parámetro model para seleccionar modelos más rápidos cuando sea apropiado:

# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'

Ranking de velocidad de los modelos (de más rápido a más lento):

  1. gpt-4o-mini / gemini-3.6-flash - Ideal para casos críticos en velocidad
  2. gpt-4o / claude-sonnet-4-5 - Equilibrio entre velocidad y calidad
  3. Default (seleccionado por el servidor) - Optimizado para calidad

Mantén los mensajes concisos

Los historiales de conversación más cortos reducen el tiempo de procesamiento. Incluye solo el contexto relevante en el array messages.

Minds "calientes"

La primera solicitud a un mind tras un periodo de inactividad puede ser ligeramente más lenta por efectos de cold-start. Las solicitudes posteriores se benefician de embeddings cacheados y conexiones ya calentadas.

Streaming (próximamente)

Estamos trabajando en soporte de streaming para el endpoint de completion, que entregará los primeros tokens mucho más rápido mientras se genera la respuesta completa. Esto mejorará significativamente la latencia percibida en aplicaciones interactivas.

Rate limits

La API v1 aplica una ventana fija configurable por cuenta autenticada (300 solicitudes por minuto de forma predeterminada). Lee los headers RateLimit-*, respeta Retry-After tras un 429 y limita la concurrencia. Consulta Errores y límites.

Siguientes pasos