Minds Team

Latency

فهم زمن استجابة الاستجابة وما الذي يُسهم فيه، وكيف يُقارن باستدعاء النماذج الأساسية مباشرةً.

افهم كيف تُقارن أزمنة استجابة Minds API باستدعاء النماذج الأساسية (foundation models) مباشرةً، وما الذي يُسهم في الفرق.

نظرة عامة

عندما ترسل رسالة عبر Minds API، تتضمن الاستجابة أكثر من مجرد استدعاء LLM خام. ينسّق API عدة خطوات لتأسيس الاستجابة على قاعدة معرفة الـ mind الخاص بك، مما يوفر إجابات أكثر جودة وسياقية.

أزمنة الاستجابة النموذجية:

ScenarioLatency
استدعاء مباشر للنموذج الأساسي (بدون سياق)1-3s
Minds API (مع تأسيس المعرفة)5-12s
Minds API (تحية بسيطة / بدون RAG)2-4s

يُصرف الوقت الإضافي على استرجاع المعرفة والتأسيس، وهو ما يجعل استجابات Minds أكثر دقة وسياقية من استدعاءات LLM الخام.

ما الذي يحدث خلال الطلب

عندما تستدعي POST /api/v1/sparks/{sparkId}/completion، ينفّذ API هذه الخطوات:

1. Authentication & mind loading          ~50ms
2. Knowledge retrieval (RAG)              ~1-3s
   - Semantic search across embeddings
   - Retrieve relevant knowledge chunks
3. Tool orchestration                     ~1-3s
   - Web search (if needed)
   - Knowledge grounding & citations
4. LLM generation                         ~1-3s
   - Same latency as calling the model directly
5. Response formatting & citations         ~50ms

الخطوتان 2-3 هما ما يميّز Minds عن استدعاء API خام. يوفران للـ mind الخاص بك سياقاً ذا صلة من قاعدة معرفته ونتائج البحث على الإنترنت والاقتباسات المؤسَّسة.

نتائج قياس الأداء

قيست في 12 مارس 2026. تم تشغيل كل اختبار 3 مرات بنفس البرومبت. تتضمن استدعاءات Minds API pipeline RAG الكامل وتنسيق الأدوات.

أزمنة الاستجابة حسب النموذج

EndpointAvgMinMax
Minds API (default)12,166ms10,951ms13,910ms
Minds API (gpt-4o)7,013ms5,900ms8,203ms
Minds API (gpt-4o-mini)6,651ms4,702ms7,975ms
Minds API (gemini-2.5-flash)7,553ms5,170ms11,198ms
Direct OpenAI (gpt-4o)1,461ms1,139ms1,720ms
Direct OpenAI (gpt-4o-mini)1,784ms1,589ms1,925ms
Direct Google (gemini-2.5-flash)1,593ms1,466ms1,701ms

تفصيل الفارق

ModelMinds APIDirectOverhead
gpt-4o-mini6,651ms1,784ms+4,867ms
gpt-4o7,013ms1,461ms+5,551ms
gemini-2.5-flash7,553ms1,593ms+5,960ms

متوسط الفارق: ~5.5 ثانية عبر جميع النماذج المختبرة. يغطي هذا الفارق:

  • البحث الدلالي عبر vector embeddings للـ mind
  • استرجاع وترتيب قطع المعرفة
  • التحقق من بحث الويب (عند الاقتضاء)
  • رسم الاقتباسات وتأسيس الاستجابة
  • pipeline تنسيق الأدوات

ما يمنحك إياه هذا الفارق

زمن الاستجابة الإضافي هو ثمن الذكاء. استدعاء LLM خام لا يمتلك أي سياق عن مجالك. يوفر Minds:

  1. تأسيس المعرفة: الاستجابات مبنية على قاعدة المعرفة المحددة للـ mind، وليس فقط على بيانات تدريب النموذج
  2. الاقتباسات التلقائية: اعرف بالضبط أي مصادر أسّست الاستجابة
  3. التحقق عبر البحث على الإنترنت: قارن المعرفة بمعلومات الويب الحية
  4. اتساق الشخصية: تحافظ الاستجابات على شخصية الـ mind وأنماط التواصل الخاصة به
  5. أنماط التفكير: نمذجة نفسية تشكّل طريقة تفكير الـ mind

تحسين Latency

اختر النموذج المناسب

استخدم معامل model لاختيار نماذج أسرع عند الاقتضاء:

# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
  -H "Authorization: Bearer minds_your_api_key" \
  -H "Content-Type: application/json" \
  -d '{
    "messages": [{"role": "user", "content": "Quick question"}],
    "model": "gpt-4o-mini"
  }'

ترتيب سرعة النماذج (من الأسرع إلى الأبطأ):

  1. gpt-4o-mini / gemini-3.6-flash — الأفضل لحالات الاستخدام الحرجة للسرعة
  2. gpt-4o / claude-sonnet-4-5 — سرعة وجودة متوازنة
  3. الافتراضي (محدد من قبل الخادم) — مُحسَّن للجودة

اجعل الرسائل موجزة

يؤدي قصر سجلات المحادثة إلى تقليل وقت المعالجة. ضمّن فقط السياق ذا الصلة في مصفوفة messages.

Warm Minds

قد يكون الطلب الأول لـ mind بعد فترة من عدم النشاط أبطأ قليلاً بسبب تأثيرات cold-start. تستفيد الطلبات اللاحقة من embeddings المخزنة والاتصالات المُسخَّنة.

Streaming (قريباً)

نعمل على دعم streaming لـ endpoint الإكمال، والذي سيوصل أول tokens أسرع بكثير أثناء توليد الاستجابة الكاملة. سيحسّن هذا بشكل كبير الـ latency المُدرَك للتطبيقات التفاعلية.

Rate Limits

يفرض v1 API حداً ثابت النافذة وقابلاً للضبط لكل حساب مصادق عليه (300 طلب في الدقيقة افتراضياً). اقرأ ترويسات RateLimit-* والتزم بـRetry-After بعد 429 وحدّ التوازي. راجع Errors & Limits.

الخطوات التالية

  • Chat API — إرسال الرسائل والحصول على الاستجابات
  • Knowledge API — إدارة قاعدة معرفة الـ spark
  • API Overview — مرجع كامل لـ endpoints