·Validation·Minds Team

اختبرنا الجماهير الاصطناعية في مواجهة الواقع

ما تكشفه خمس مجموعات بيانات استقصائية عامة حول دقة الجماهير الاصطناعية، بما في ذلك اختبار إنتاجي شمل 301 من عقول Minds لجيل ما بعد الألفية (Gen Z)، وأين يفيد التأصيل عبر الملفات الشخصية.

يحتاج البحث الاصطناعي إلى مرجع خارجي: إجابات من أشخاص حقيقيين. قارنت حزمة أبحاثنا الأصلية الإجابات الاصطناعية بأربع مجموعات بيانات استقصائية عامة ومعيارين نوعيين. وأضاف اختبار إنتاجي لاحق لدراسة Food and You فحصا عمليا للإجابة عن السؤال ذاته: إلى أي مدى يمكن لجمهور من عقول Minds الدائمة إعادة إنتاج توزيعات الإجابات لاستطلاع حقيقي بدقة؟

تشير النتائج إلى مصدرين مختلفين للقيمة. فالحفاظ على عدم اليقين يحسن تقديرات التوزيع الاستقصائي. وتوفر الملفات الشخصية للمشاركين والذكريات ذات الصلة قيمة إضافية عندما تعتمد الإجابة على تجارب الفرد وأسبابه وقيمه. وتتباين فوائدهما بحسب المهمة.

دراسات الاستطلاع المعاد تنفيذها والمختارة

متوسط خطأ التوزيع

استبيانات ومجموعات مختلفة؛ نتائج PISA موزونة. الخطأ الأقل أفضل. لا تجمع هذه النتائج في درجة دقة واحدة.

  • GSS 20247.53
  • ANES 20248.33
  • CES 20244.72
  • PISA 20226.20
  • Food and You 2, Wave 106.01
0نقاط مئوية · الأقل أفضل10
الدراسة المعاد تنفيذهامجموعة البيانات العامة الأصليةالنتيجة
إعادة تنفيذ استطلاع GSS 2024GSS 2024تقريب 92.47% · متوسط خطأ 7.53 pp
إعادة تنفيذ ANES 2024 الطوليةANES 2024 Time Series Studyتقريب 91.67% · متوسط خطأ 8.33 pp
إعادة تنفيذ CES 2024 قبل/بعد2024 Canadian Election Studyتقريب 95.28% · متوسط خطأ 4.72 pp
إعادة تنفيذ PISA 2022 الدوليةPISA 2022 Databaseتقريب 93.80% · متوسط خطأ مرجح 6.20 pp
إعادة تنفيذ Food and You 2 في الإنتاجFood and You 2, Wave 10تقريب 93.99% · متوسط خطأ 6.01 pp · Pearson 0.804 · Spearman 0.834

يعني التقريب الإجمالي: 100 مطروحا منها متوسط الخطأ المطلق بنقاط النسبة المئوية. وهو يقيس الفجوة بين توزيعات الإجابات، ولا يعني أنه تم التنبؤ بالنسب نفسها من الأفراد بشكل صحيح. تستخدم الدراسات أدوات وتفاصيل تجميع مختلفة، بما في ذلك نتيجة PISA الموزونة، ولا ينبغي حساب متوسط هذه الصفوف للحصول على درجة دقة واحدة.

تعود الصفوف الأربعة الأولى إلى تجارب الاستقصاء المعزولة الأصلية. أما الصف الخامس فيمثل تشغيلا إنتاجيا لاحقا على فوج مقفل مسبقا. ويؤدي إدراجه إلى توسيع نطاق الأدلة دون تحويل التكرار على ذلك الفوج إلى دراسة سكانية مستقلة جديدة.

جيل Gen Z: استبيان حقيقي عبر المنتج

سأل استطلاع Food and You 2 التابع لـ Food Standards Agency في المملكة المتحدة عن مدى تكرار تناول الشباب للطعام خارج المنزل أو شراء وجبات جاهزة للإفطار والغداء والعشاء. وطرحت المقارنة الإنتاجية الأسئلة الثلاثة نفسها على 301 من عقول Minds الدائمة التي تتراوح أعمارها بين 16 و24 عاما، وقارنت التوزيعات الناتجة بالنتائج المنشورة لفئة الشباب. وكانت قاعدة المشاركين البشريين لكل سؤال خاضع للتقييم 257 مشاركا.

اكتملت جميع الاستجابات المخطط لها والبالغ عددها 903 استجابات. وعبر 21 خانة لخيارات الإجابة، بلغ متوسط الخطأ المطلق 6.01 نقطة مئوية وبلغ متوسط تداخل التوزيع 78.98%. ويصف هذان المقياسان خاصيتين مختلفتين: يلخص تحويل التقريب متوسط خطأ الخانات، بينما يوضح التداخل مقدار الكتلة الاحتمالية المشتركة بين التوزيعات.

حقق تشغيل 18 August تحسنا مقارنة بنتيجة 9 August باستخدام الفوج والأداة نفسهما: انخفض الخطأ من 7.33 إلى 6.01 نقطة، وهو انخفاض نسبي قدره 18.0%. وشهد كل سؤال تحسنا. وكانت هذه المقارنة اختبار انحدار للمنتج مع ضابط تاريخي، وليست مقارنة عشوائية متزامنة.

يعد سياق خط الأساس أمرا مهما؛ حيث سجل موجه احتمالي عام ومجمد خطأ قدره 6.68 نقطة، وسجل نموذج العدم متساوي الاحتمالات 7.00 نقاط على الخانات نفسها. كانت النتيجة الإنتاجية أفضل وصفيا، لكن خطوط الأساس تلك لم تتم إعادة تشغيلها في الوقت نفسه. بالتالي، لا ينبغي اعتبار الحصول على درجة في التسعينيات على مقياس التقريب ميزة كبيرة في حد ذاته.

توضح المقالة الكاملة لاستطلاع طعام جيل Gen Z الجمهور، والاستبيان، ومصدر البيانات، ونتائج كل سؤال على حدة. قدمت Food Standards Agency مجموعة البيانات المرجعية العامة، دون أن ترعى دراسة Minds هذه أو تصادق عليها أو تراجعها.

لماذا أدى عدم اليقين إلى تحسين تقديرات الاستطلاعات

في تجارب الاستقصاء الأربع الأصلية، قللت الإجابات الاحتمالية من خطأ التوزيع بمقدار 12.47 إلى 19.72 نقطة مئوية مقارنة بفرض إجابة واحدة. وقد ظهر هذا التحسن عبر جميع مجموعات البيانات الأربع.

تحتفظ الإجابة الاحتمالية بدرجة عدم اليقين التي يهملها الاختيار الفئوي الحاسم. وعند تجميع هذه الاحتمالات عبر جمهور كامل، يمكنها استعادة التوزيع السكاني بدقة أكبر مقارنة باختيار إجباري واحد من كل مستجيب اصطناعي.

ترتبط هذه النتيجة بجمع الاستجابات وتجميعها. ولم تُظهر التجارب ذاتها تفوق الملفات الشخصية التفصيلية باستمرار على الموجهات الاحتمالية الديموغرافية؛ فسياق المقارنة الأساسي وشكل الاستجابة يكتسبان الأهمية ذاتها التي تحظى بها الدرجة النهائية.

عمليات تحقق أخرى مختارة

تستخدم هذه الدراسات مخرجات مختلفة، ولذلك سيكون استخدام نسبة مئوية للتقريب مضللا. وهي تكمل الأدلة الاستقصائية بدلا من توسيع نطاق دقتها.

الدراسة والنتائج التفصيليةالعينة الخاضعة للتقييمالنتيجة المسجلةالتقريب
PRISM Alignment299 مشاركا، 869 عنصرامعدل فوز لملاءمة المشارك بنسبة 32.6%؛ 25.7% للديموغرافي و20.5% للعاملا ينطبق
Held-out interviews22 شخصا، 66 إجابة، مجموعتان من النصوص+24.37 نقطة مركبة مقارنة بالموجهات العامة، تقدير مجمع حسب المشاركينلا ينطبق
Named foundation modelsالأشخاص الـ 22 والإجابات الـ 66 أنفسهم، ليس فوجا جديدا+25.49 نقطة مقارنة بـ GPT-5.4؛ و+30.05 مقارنة بـ Claude Sonnet 5لا ينطبق
Spark creative diversityسبع مهام إبداعيةمتوسط تنوع 7.90/10 مقابل خط أساس منتظم قدره 3.14/10لا ينطبق

تقيم دراسة Spark تنوع الأفكار، وليس التوافق مع استطلاع تمثيلي أو التنبؤ بالأداء الإعلاني الحقيقي. وتعتمد مقارنات المقابلات على محكمين آليين، وليس على نسبة مئوية للأشخاص الذين جرت محاكاتهم بدقة.

أين كان سياق المشاركين مفيدا

قيّمت الاختبارات النوعية الأصلية الإجابات البشرية اللاحقة التي حُجبت عن مرحلة التوليد. وفي مقارنة PRISM Alignment، حققت عقول Minds الكاملة معدل فوز أعمى بلغ 32.6%، مقارنة بـ 25.7% للموجهات الديموغرافية و20.5% للموجهات العامة. وتعد مجموعة بيانات PRISM هذه معيارا مرجعيا خارجيا مستقلا عن منهجية PRISM الخاصة بـ Minds.

استخدم التأكيد المستقل للمقابلات مجموعتين عامتين من النصوص، و22 شخصا، و66 إجابة لاحقة. وأظهر التقرير تفوقا إيجابيا للملف التعريفي مع الاسترجاع مقارنة بالموجهات العامة عبر المجموعتين وتحت تقييم نسخة ثانية من نظام التحكيم. وتستكشف مقارنة النماذج التأسيسية المحددة هذه الميزة مقارنة بإجابات GPT وClaude العامة. ولم تتلق خطوط الأساس تلك أي سجل تاريخي للمشاركين.

تركز هذه التجارب على ملاءمة المشارك، والأسباب، والدقة، ونبرة الصوت. ولا ينبغي دمج درجات التحكيم الخاصة بها مع النسب المئوية لتوزيع الاستطلاعات؛ فكلاهما يعتمد على الأدلة التي يتلقاها المستجيب الاصطناعي، كما لا تزال التقييمات النوعية بحاجة إلى تأكيد من مقيّمين بشريين مستقلين.

حدود تعميم هذه الأدلة

شملت الحزمة الأصلية 1,881 مشاركا عبر معاييرها الاستقصائية والنوعية. أما التشغيل الإضافي الخاص بالطعام لـ 301 من عقول Minds، فله فوجه ومقامه المرجعي البشري الخاص به، ويجب أن يظلا منفصلين.

حُجبت الأهداف عن مدخلات وقت التشغيل في الاختبارات المسجلة. ومع ذلك، ربما ظهرت بيانات المصادر العامة أثناء التدريب المسبق للنماذج، وبالتالي لا يضمن الفصل في وقت التشغيل غياب أي تعرض مسبق بالكامل. كما جاءت نتائج الاستطلاعات الأصلية من أطر اختبار معزولة؛ ولذا فهي لا تثبت سلوكا متطابقا عبر كل إصدار من إصدارات المنتج. واستخدمت دراسة PISA الصياغة الأصلية باللغة الإنجليزية عبر دولها الخمس.

تقدم هذه النظرة العامة الأدلة المعتمدة المشمولة هنا، ولا تمثل إحصاء شاملا لكل تجربة أجرتها Minds. فالاختبارات الاستكشافية وغير الناجحة الأخرى تتطلب سياقها الخاص. وتكمن الفائدة العملية لهذه النتائج في اختيار الجمهور المناسب، وشكل الاستجابة، ومنهجية التحقق لسؤال محدد.

اقرأ كيفية بناء لجان أبحاث Minds للتعرف على سير العمل، واستعن بـ قائمة التحقق من الصحة عند اتخاذ القرار بشأن ما يمكن للنتيجة الاصطناعية دعمه.