·Methodology·Minds Team

كيفية قراءة ادعاءات دقة الجمهور الاصطناعي

تنشر تسع شركات للجمهور الاصطناعي أرقام دقة. تستخدم مقاييس مختلفة، وخطوط أساس مختلفة، وعينات مختلفة، لذا لا يمكن ترتيب الأرقام مقارنة ببعضها. تفصل ثمانية أسئلة بين الادعاء القابل للتحقق والادعاء الذي لا يمكن التحقق منه.

تنشر شركات البحث الاصطناعي أرقام دقة تتراوح بين 85% و98%. عند القراءة بسرعة، يبدو أن المجال مستقر والاختلافات تبدو صغيرة.

لكنها ليست قابلة للمقارنة. تقيس النسب كميات مختلفة مقابل خطوط أساس مختلفة في مهام مختلفة، والعديد منها لا يقيس الدقة على الإطلاق. يحدد هذا المقال ما وجدناه عند قراءة المواد المنشورة لتسع بائعين في سبتمبر 2026، بما في ذلك موادنا الخاصة، والأسئلة الثمانية التي تفصل بين الادعاء القابل للتحقق والادعاء الذي لا يمكن التحقق منه.

لدينا مصلحة هنا. تبيع Minds الجماهير الاصطناعية. لذا فإن المعيار أدناه يُطبق علينا بنفس الشروط، والمكان الذي نخرج منه بأقل نتيجة يُذكر بوضوح مثل الآخرين.

الأسئلة الثمانية

يكون ادعاء الدقة المنشور قابلاً للتحقق عندما يجيب على هذه الأسئلة:

  1. ضد أي معيار خارجي؟ مجموعة بيانات مستقلة مسماة أو دراسة منشورة، وليس عينة داخلية.
  2. ضد أي حد أقصى؟ لا يعيد البشر إنتاج إجاباتهم بدقة. اتساقهم الذاتي هو الحد الأقصى الواقعي.
  3. ضد أي حد أدنى؟ ما تسجله نفس المقياس بدون نموذج خلفه.
  4. ماذا يعني المقياس؟ "الدقة" ليست معرفة ذاتية.
  5. مقارنة بأي خط أساس؟ تحفيز ساذج لنفس النموذج هو المقارنة التي تهم، لأن ذلك هو البديل المجاني.
  6. راجع من؟ مراجعة الأقران أو ما قبل الطباعة تدعو إلى التصحيح.
  7. أين تفشل؟ طريقة بدون وضع فشل منشور لم يتم اختبارها بشكل كافٍ للعثور على واحدة.
  8. هل يمكن لأي شخص التحقق منها؟ الطريقة، العينة والبيانات متاحة للتفتيش.

ما ينشره المجال

تم تجميعه من الصفحات العامة والأوراق الخاصة بالبائعين، سبتمبر 2026.

البائعالرقم الرئيسيما يقيسه
Simile85% من موثوقية إعادة اختبار البشرإعادة إنتاج إجابات الأفراد المصدرين، مقابل حد الضوضاء البشري
Artificial Societies86% دقة التوزيعتطابق التوزيع، مقابل حد أقصى بشري محدد بنسبة 91%
Articos86% من الموضوعات التي حددها الخبراءاستعادة الموضوعات مقابل التقارير المنشورة للخبراء
Evelance89.78% تداخل موضوعيتطابق الموضوع، 7 شخصيات مقابل 23 مستخدمًا حقيقيًا
Synthetic Users85–92% "مساواة عضوية اصطناعية"تشابه المقابلات الاصطناعية مع الحقيقية
Aaru0.90 ارتباط وسطيارتباط في دراسة عميل واحدة
Evidenza88% دقة، 0.81 ارتباطالمقياس غير معرف علنًا
Fairgen98% معدل اجتياز الصحةبوابة جودة داخلية، ليست دقة
MindsSpearman 0.85، +4% انحياز المقياسارتباط الرتبة على 54 إعلانًا مقابل لجنة بشرية

تتبع ملاحظتان، ولا تتعلق أي منهما بأي منتج هو الأفضل.

أعلى رقم ليس رقم دقة. 98% من Fairgen هو نسبة الملفات الشخصية المولدة التي تجتاز بوابة الجودة ذات الأبعاد الستة الخاصة بهم. لا تقول شيئًا عن ما إذا كانت المخرجات تتطابق مع البيانات البشرية، وFairgen لا تدعي ذلك. أي شخص يقوم بترتيب هذه الجدول حسب النسبة سيصنفهم أولاً على مقياس لم يدخلوا فيه أبدًا.

فقط رقمين قابلين للمقارنة. 85% من Simile و86% من Artificial Societies كلاهما معبر عنه كنسبة مما يحققه البشر أنفسهم. يمكن مقارنتهما. لا يمكن مقارنة أي شيء آخر في العمود مع أي شيء، بما في ذلك مع بعضهما البعض.

من ينشر الفشل

هنا حيث ينفصل المجال بشكل حاد.

تذكر Fairgen الدراسات التي لا تناسب طريقتها: تتبع العلامة التجارية، التقسيم، التوافق. توجيههم هو "اختبار الضغط قبل الذهاب إلى الميدان، وليس بدلاً من ذلك". تشير Synthetic Users إلى أن المستجيبين الاصطناعيين "بدون معايرة يمكن أن يكونوا مقبولين فرديًا، لكنهم خاطئون جماعيًا". يقول كل من Articos وEvelance إن مخرجاتهم توجيهية وتندرج بجانب البحث البشري بدلاً من أن تحل محله.

لا تنشر Aaru وEvidenza وArtificial Societies أي شروط فشل يمكننا العثور عليها.

أين نقف، بما في ذلك الفجوة

تستخدم دراساتنا الخاصة إلغاءً بأربعة شروط، وتحتفظ بإجابات حقيقية، وتغلق اختيارات المرشحين قبل فتح الأهداف، وتبلغ عن الحد الأدنى للفرصة بجانب النتيجة. في مجموعة عناصر GSS واحدة، يسجل التوزيع المسطح بدون نموذج خلفه بالفعل 83.71%؛ 92.47% لدينا تغلق 54% من المسافة المتبقية. ينتمي الحد الأدنى بجانب النسبة، وغالبًا ما يكون مفقودًا.

نحن ننشر نتائج لم تنجح. كان رفع الملف الشخصي المسجل بمقدار 0.17 نقطة له فترة ثقة بنسبة 95% من -1.00 إلى +1.31، وعبر الصفر، وفشل في معيار الترويج الخاص به. في تحفيزات يومية قصيرة في مقارنة معماة، فازت جماهيرنا بنسبة 13.8% مقابل 30.5% للتحفيزات العامة و34.0% للتحفيزات الديموغرافية. هذه خسارة، وهي منشورة.

ما ليس لدينا هو مراجعة الأقران. ظهرت نتيجة ضبط Simile في EMNLP 2025 مع مجموعة بيانات مفتوحة من 2.9 مليون استجابة. لدى Artificial Societies نتيجة سلوك جماعي في المجلة البريطانية لعلم النفس (British Journal of Psychology). ليس لدينا أي منهما. تم نشر عملنا في التحقق على موقعنا الخاص ولم يمر عبر مراجعة خارجية، وحتى يحدث ذلك، يكون القارئ محقًا في تقييمه بشكل مختلف.

تُقرأ شراكتنا مع SINUS-Institut أحيانًا على أنها تحقق. لكنها ليست كذلك. إنها أصل: يأتي نموذج البيئة الذي تستند إليه شخصياتنا من عقود من أبحاثهم، وهو بيان حول المدخلات بدلاً من الدقة. يضع مديرهم العام الأمر بوضوح: "لا تحل Milieu-Minds محل البحث الاجتماعي ولا خبرة معهدنا".

كيفية التحقق من أي بائع في عشر دقائق

اطلب تعريف المقياس، حجم العينة، خط الأساس، وظروف الفشل. اسأل عما تسجله نفس المقياس بدون نموذج خلفه. إذا لم يتمكن بائع من إنتاج تلك المعلومات، فإن النسبة هي تسويق، بغض النظر عن من نشرها ومدى إيجابيتها.

هذا الاختبار ليس مريحًا لنا أيضًا. إنه ببساطة الاختبار الوحيد الذي يخبر المشتري بأي شيء.

المصادر

جميع الأرقام الواردة أعلاه مأخوذة من المواد العامة الخاصة بكل مزوّد، تم الاطلاع عليها في 22 سبتمبر 2026. الادعاءات تتغير؛ تحقق من المصدر قبل الاعتماد عليه. إذا أخطأنا في قراءة مصدرك، فأخبرنا وسنصححه.

الأسئلة الشائعة

ما مدى دقة الجماهير الاصطناعية؟

لا يوجد رقم واحد. تتراوح الأرقام المنشورة بين 85% و98%، لكنها تقيس أشياء مختلفة: تداخل الموضوعات، تطابق التوزيع، اتساق الاستجابة، معدلات اجتياز جودة البوابة، وارتباط الرتبة ليست قابلة للتبادل. رقم الدقة له معنى فقط بجانب مقاييسه، وخط الأساس، والمهمة التي تم قياسه عليها.

لماذا لا يمكنني مقارنة نسب دقة بائعين اثنين؟

لأن المقام مختلف. قد يبلغ بائع عن نسبة الموضوعات التي يستعيدها من التقارير الخبراء، بينما يبلغ آخر عن نسبة توزيع الاستجابة التي يطابقها، وآخر عن نسبة الملفات الشخصية المولدة التي تجتاز بوابة الجودة الداخلية. ترتيب تلك الأرقام مقارنة ببعضها ينتج ترتيبًا بلا معنى.

ما هو الحد الأقصى البشري، ولماذا يهم؟

لا يعيد البشر إنتاج إجابات استطلاعاتهم بدقة. عند سؤالهم مرة أخرى بعد أسبوعين، يختلفون عن أنفسهم. معدل الاتساق الذاتي هو الحد الأقصى الواقعي لأي محاكاة، لذا فإن الإبلاغ عن نتيجة كنسبة منه أكثر إفادة من الإبلاغ عن نسبة خام.

ما هو الحد الأدنى للفرصة؟

النتيجة التي تحققها طريقة ما بدون نموذج وبدون بيانات خلفها. في إحدى مجموعات عناصر GSS لدينا، يسجل التوزيع المسطح بالفعل 83.71%. وبالتالي، فإن 92.47% المبلغ عنها تغلق 54% من المسافة بين ذلك الحد ونتيجة مثالية، وهو ادعاء مختلف تمامًا عن '92% دقيق'.

Minds© 2026 Minds. جمهورك المستهدف. مدعوم بالذكاء الاصطناعي ومستند إلى أدلة شفافة. جاهز في دقائق.
Minds جزء من
ESOMARGreenBookInsight PlatformsCapterraG2CSSDA Best UX Design AwardCSSDA Best Innovation AwardCSSDA Best UI Design Award