Latency
فهم زمن استجابة الاستجابة وما الذي يُسهم فيه، وكيف يُقارن باستدعاء النماذج الأساسية مباشرةً.
افهم كيف تُقارن أزمنة استجابة Minds API باستدعاء النماذج الأساسية (foundation models) مباشرةً، وما الذي يُسهم في الفرق.
نظرة عامة
عندما ترسل رسالة عبر Minds API، تتضمن الاستجابة أكثر من مجرد استدعاء LLM خام. ينسّق API عدة خطوات لتأسيس الاستجابة على قاعدة معرفة الـ mind الخاص بك، مما يوفر إجابات أكثر جودة وسياقية.
أزمنة الاستجابة النموذجية:
| Scenario | Latency |
|---|---|
| استدعاء مباشر للنموذج الأساسي (بدون سياق) | 1-3s |
| Minds API (مع تأسيس المعرفة) | 5-12s |
| Minds API (تحية بسيطة / بدون RAG) | 2-4s |
يُصرف الوقت الإضافي على استرجاع المعرفة والتأسيس، وهو ما يجعل استجابات Minds أكثر دقة وسياقية من استدعاءات LLM الخام.
ما الذي يحدث خلال الطلب
عندما تستدعي POST /api/v1/sparks/{sparkId}/completion، ينفّذ API هذه الخطوات:
1. Authentication & mind loading ~50ms
2. Knowledge retrieval (RAG) ~1-3s
- Semantic search across embeddings
- Retrieve relevant knowledge chunks
3. Tool orchestration ~1-3s
- Web search (if needed)
- Knowledge grounding & citations
4. LLM generation ~1-3s
- Same latency as calling the model directly
5. Response formatting & citations ~50ms
الخطوتان 2-3 هما ما يميّز Minds عن استدعاء API خام. يوفران للـ mind الخاص بك سياقاً ذا صلة من قاعدة معرفته ونتائج البحث على الإنترنت والاقتباسات المؤسَّسة.
نتائج قياس الأداء
قيست في 12 مارس 2026. تم تشغيل كل اختبار 3 مرات بنفس البرومبت. تتضمن استدعاءات Minds API pipeline RAG الكامل وتنسيق الأدوات.
أزمنة الاستجابة حسب النموذج
| Endpoint | Avg | Min | Max |
|---|---|---|---|
| Minds API (default) | 12,166ms | 10,951ms | 13,910ms |
| Minds API (gpt-4o) | 7,013ms | 5,900ms | 8,203ms |
| Minds API (gpt-4o-mini) | 6,651ms | 4,702ms | 7,975ms |
| Minds API (gemini-2.5-flash) | 7,553ms | 5,170ms | 11,198ms |
| Direct OpenAI (gpt-4o) | 1,461ms | 1,139ms | 1,720ms |
| Direct OpenAI (gpt-4o-mini) | 1,784ms | 1,589ms | 1,925ms |
| Direct Google (gemini-2.5-flash) | 1,593ms | 1,466ms | 1,701ms |
تفصيل الفارق
| Model | Minds API | Direct | Overhead |
|---|---|---|---|
| gpt-4o-mini | 6,651ms | 1,784ms | +4,867ms |
| gpt-4o | 7,013ms | 1,461ms | +5,551ms |
| gemini-2.5-flash | 7,553ms | 1,593ms | +5,960ms |
متوسط الفارق: ~5.5 ثانية عبر جميع النماذج المختبرة. يغطي هذا الفارق:
- البحث الدلالي عبر vector embeddings للـ mind
- استرجاع وترتيب قطع المعرفة
- التحقق من بحث الويب (عند الاقتضاء)
- رسم الاقتباسات وتأسيس الاستجابة
- pipeline تنسيق الأدوات
ما يمنحك إياه هذا الفارق
زمن الاستجابة الإضافي هو ثمن الذكاء. استدعاء LLM خام لا يمتلك أي سياق عن مجالك. يوفر Minds:
- تأسيس المعرفة: الاستجابات مبنية على قاعدة المعرفة المحددة للـ mind، وليس فقط على بيانات تدريب النموذج
- الاقتباسات التلقائية: اعرف بالضبط أي مصادر أسّست الاستجابة
- التحقق عبر البحث على الإنترنت: قارن المعرفة بمعلومات الويب الحية
- اتساق الشخصية: تحافظ الاستجابات على شخصية الـ mind وأنماط التواصل الخاصة به
- أنماط التفكير: نمذجة نفسية تشكّل طريقة تفكير الـ mind
تحسين Latency
اختر النموذج المناسب
استخدم معامل model لاختيار نماذج أسرع عند الاقتضاء:
# Fastest: lightweight models
curl -X POST "https://api.getminds.ai/v1/sparks/{sparkId}/completion" \
-H "Authorization: Bearer minds_your_api_key" \
-H "Content-Type: application/json" \
-d '{
"messages": [{"role": "user", "content": "Quick question"}],
"model": "gpt-4o-mini"
}'
ترتيب سرعة النماذج (من الأسرع إلى الأبطأ):
gpt-4o-mini/gemini-3.6-flash— الأفضل لحالات الاستخدام الحرجة للسرعةgpt-4o/claude-sonnet-4-5— سرعة وجودة متوازنة- الافتراضي (محدد من قبل الخادم) — مُحسَّن للجودة
اجعل الرسائل موجزة
يؤدي قصر سجلات المحادثة إلى تقليل وقت المعالجة. ضمّن فقط السياق ذا الصلة في مصفوفة messages.
Warm Minds
قد يكون الطلب الأول لـ mind بعد فترة من عدم النشاط أبطأ قليلاً بسبب تأثيرات cold-start. تستفيد الطلبات اللاحقة من embeddings المخزنة والاتصالات المُسخَّنة.
Streaming (قريباً)
نعمل على دعم streaming لـ endpoint الإكمال، والذي سيوصل أول tokens أسرع بكثير أثناء توليد الاستجابة الكاملة. سيحسّن هذا بشكل كبير الـ latency المُدرَك للتطبيقات التفاعلية.
Rate Limits
يفرض v1 API حداً ثابت النافذة وقابلاً للضبط لكل حساب مصادق عليه (300 طلب في الدقيقة افتراضياً). اقرأ ترويسات RateLimit-* والتزم بـRetry-After بعد 429 وحدّ التوازي. راجع Errors & Limits.
الخطوات التالية
- Chat API — إرسال الرسائل والحصول على الاستجابات
- Knowledge API — إدارة قاعدة معرفة الـ spark
- API Overview — مرجع كامل لـ endpoints