---
title: "اختبرنا الجماهير الاصطناعية في مواجهة الواقع"
description: "ما تكشفه خمس مجموعات بيانات استقصائية عامة حول دقة الجماهير الاصطناعية، بما في ذلك اختبار إنتاجي شمل 301 من عقول Minds لجيل ما بعد الألفية (Gen Z)، وأين يفيد التأصيل عبر الملفات الشخصية."
canonical_url: "https://getminds.ai/research/ar/synthetic-audiences-reality-benchmark-2026"
last_updated: "2026-09-08T17:53:25.335Z"
---

# اختبرنا الجماهير الاصطناعية في مواجهة الواقع

يحتاج البحث الاصطناعي إلى مرجع خارجي: إجابات من أشخاص حقيقيين. قارنت حزمة أبحاثنا الأصلية الإجابات الاصطناعية بأربع مجموعات بيانات استقصائية عامة ومعيارين نوعيين. وأضاف اختبار إنتاجي لاحق لدراسة Food and You فحصا عمليا للإجابة عن السؤال ذاته: إلى أي مدى يمكن لجمهور من عقول Minds الدائمة إعادة إنتاج توزيعات الإجابات لاستطلاع حقيقي بدقة؟

تشير النتائج إلى مصدرين مختلفين للقيمة. فالحفاظ على عدم اليقين يحسن تقديرات التوزيع الاستقصائي. وتوفر الملفات الشخصية للمشاركين والذكريات ذات الصلة قيمة إضافية عندما تعتمد الإجابة على تجارب الفرد وأسبابه وقيمه. وتتباين فوائدهما بحسب المهمة.

## دراسات الاستطلاع المعاد تنفيذها والمختارة

<research-figure :labels="["GSS 2024","ANES 2024","CES 2024","PISA 2022","Food and You 2, Wave 10"]" figure="synthetic-audiences-reality-benchmark-2026" note="استبيانات ومجموعات مختلفة؛ نتائج PISA موزونة. الخطأ الأقل أفضل. لا تجمع هذه النتائج في درجة دقة واحدة." title="متوسط خطأ التوزيع" unitLabel="نقاط مئوية · الأقل أفضل">



</research-figure>

<table>
<thead>
  <tr>
    <th>
      الدراسة المعاد تنفيذها
    </th>
    
    <th>
      مجموعة البيانات العامة الأصلية
    </th>
    
    <th>
      النتيجة
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <a href="/research/gss-2024-synthetic-survey-validation">
        إعادة تنفيذ استطلاع GSS 2024
      </a>
    </td>
    
    <td>
      <a href="https://gss.norc.org/" rel="nofollow">
        GSS 2024
      </a>
    </td>
    
    <td>
      تقريب 92.47% · متوسط خطأ 7.53 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/anes-2024-synthetic-survey-validation">
        إعادة تنفيذ ANES 2024 الطولية
      </a>
    </td>
    
    <td>
      <a href="https://electionstudies.org/data-center/2024-time-series-study/" rel="nofollow">
        ANES 2024 Time Series Study
      </a>
    </td>
    
    <td>
      تقريب 91.67% · متوسط خطأ 8.33 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/ces-2024-synthetic-survey-validation">
        إعادة تنفيذ CES 2024 قبل/بعد
      </a>
    </td>
    
    <td>
      <a href="https://doi.org/10.7910/DVN/X11EP6" rel="nofollow">
        2024 Canadian Election Study
      </a>
    </td>
    
    <td>
      تقريب 95.28% · متوسط خطأ 4.72 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/pisa-2022-synthetic-survey-validation">
        إعادة تنفيذ PISA 2022 الدولية
      </a>
    </td>
    
    <td>
      <a href="https://www.oecd.org/en/data/datasets/pisa-2022-database.html" rel="nofollow">
        PISA 2022 Database
      </a>
    </td>
    
    <td>
      تقريب 93.80% · متوسط خطأ مرجح 6.20 pp
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/synthetic-gen-z-food-survey-validation-2026">
        إعادة تنفيذ Food and You 2 في الإنتاج
      </a>
    </td>
    
    <td>
      <a href="https://data.food.gov.uk/catalog/datasets/e5ac7f57-61d4-4e34-8d74-fe198ab5d858" rel="nofollow">
        Food and You 2, Wave 10
      </a>
    </td>
    
    <td>
      تقريب 93.99% · متوسط خطأ 6.01 pp · Pearson 0.804 · Spearman 0.834
    </td>
  </tr>
</tbody>
</table>

يعني التقريب الإجمالي: 100 مطروحا منها متوسط الخطأ المطلق بنقاط النسبة المئوية. وهو يقيس الفجوة بين توزيعات الإجابات، ولا يعني أنه تم التنبؤ بالنسب نفسها من الأفراد بشكل صحيح. تستخدم الدراسات أدوات وتفاصيل تجميع مختلفة، بما في ذلك نتيجة PISA الموزونة، ولا ينبغي حساب متوسط هذه الصفوف للحصول على درجة دقة واحدة.

تعود الصفوف الأربعة الأولى إلى تجارب الاستقصاء المعزولة الأصلية. أما الصف الخامس فيمثل تشغيلا إنتاجيا لاحقا على فوج مقفل مسبقا. ويؤدي إدراجه إلى توسيع نطاق الأدلة دون تحويل التكرار على ذلك الفوج إلى دراسة سكانية مستقلة جديدة.

## جيل Gen Z: استبيان حقيقي عبر المنتج

سأل استطلاع Food and You 2 التابع لـ Food Standards Agency في المملكة المتحدة عن مدى تكرار تناول الشباب للطعام خارج المنزل أو شراء وجبات جاهزة للإفطار والغداء والعشاء. وطرحت المقارنة الإنتاجية الأسئلة الثلاثة نفسها على 301 من عقول Minds الدائمة التي تتراوح أعمارها بين 16 و24 عاما، وقارنت التوزيعات الناتجة بالنتائج المنشورة لفئة الشباب. وكانت قاعدة المشاركين البشريين لكل سؤال خاضع للتقييم 257 مشاركا.

اكتملت جميع الاستجابات المخطط لها والبالغ عددها 903 استجابات. وعبر 21 خانة لخيارات الإجابة، بلغ متوسط الخطأ المطلق 6.01 نقطة مئوية وبلغ متوسط تداخل التوزيع 78.98%. ويصف هذان المقياسان خاصيتين مختلفتين: يلخص تحويل التقريب متوسط خطأ الخانات، بينما يوضح التداخل مقدار الكتلة الاحتمالية المشتركة بين التوزيعات.

حقق تشغيل 18 August تحسنا مقارنة بنتيجة 9 August باستخدام الفوج والأداة نفسهما: انخفض الخطأ من 7.33 إلى 6.01 نقطة، وهو انخفاض نسبي قدره 18.0%. وشهد كل سؤال تحسنا. وكانت هذه المقارنة اختبار انحدار للمنتج مع ضابط تاريخي، وليست مقارنة عشوائية متزامنة.

يعد سياق خط الأساس أمرا مهما؛ حيث سجل موجه احتمالي عام ومجمد خطأ قدره 6.68 نقطة، وسجل نموذج العدم متساوي الاحتمالات 7.00 نقاط على الخانات نفسها. كانت النتيجة الإنتاجية أفضل وصفيا، لكن خطوط الأساس تلك لم تتم إعادة تشغيلها في الوقت نفسه. بالتالي، لا ينبغي اعتبار الحصول على درجة في التسعينيات على مقياس التقريب ميزة كبيرة في حد ذاته.

توضح [المقالة الكاملة لاستطلاع طعام جيل Gen Z](/research/synthetic-gen-z-food-survey-validation-2026) الجمهور، والاستبيان، ومصدر البيانات، ونتائج كل سؤال على حدة. قدمت Food Standards Agency مجموعة البيانات المرجعية العامة، دون أن ترعى دراسة Minds هذه أو تصادق عليها أو تراجعها.

## لماذا أدى عدم اليقين إلى تحسين تقديرات الاستطلاعات

في تجارب الاستقصاء الأربع الأصلية، قللت الإجابات الاحتمالية من خطأ التوزيع بمقدار 12.47 إلى 19.72 نقطة مئوية مقارنة بفرض إجابة واحدة. وقد ظهر هذا التحسن عبر جميع مجموعات البيانات الأربع.

تحتفظ الإجابة الاحتمالية بدرجة عدم اليقين التي يهملها الاختيار الفئوي الحاسم. وعند تجميع هذه الاحتمالات عبر جمهور كامل، يمكنها استعادة التوزيع السكاني بدقة أكبر مقارنة باختيار إجباري واحد من كل مستجيب اصطناعي.

ترتبط هذه النتيجة بجمع الاستجابات وتجميعها. ولم تُظهر التجارب ذاتها تفوق الملفات الشخصية التفصيلية باستمرار على الموجهات الاحتمالية الديموغرافية؛ فسياق المقارنة الأساسي وشكل الاستجابة يكتسبان الأهمية ذاتها التي تحظى بها الدرجة النهائية.

## عمليات تحقق أخرى مختارة

تستخدم هذه الدراسات مخرجات مختلفة، ولذلك سيكون استخدام نسبة مئوية للتقريب مضللا. وهي تكمل الأدلة الاستقصائية بدلا من توسيع نطاق دقتها.

<table>
<thead>
  <tr>
    <th>
      الدراسة والنتائج التفصيلية
    </th>
    
    <th>
      العينة الخاضعة للتقييم
    </th>
    
    <th>
      النتيجة المسجلة
    </th>
    
    <th>
      التقريب
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <a href="/research/prism-alignment-participant-fit-validation">
        PRISM Alignment
      </a>
    </td>
    
    <td>
      299 مشاركا، 869 عنصرا
    </td>
    
    <td>
      معدل فوز لملاءمة المشارك بنسبة 32.6%؛ 25.7% للديموغرافي و20.5% للعام
    </td>
    
    <td>
      لا ينطبق
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/held-out-interview-response-validation">
        Held-out interviews
      </a>
    </td>
    
    <td>
      22 شخصا، 66 إجابة، مجموعتان من النصوص
    </td>
    
    <td>
      +24.37 نقطة مركبة مقارنة بالموجهات العامة، تقدير مجمع حسب المشاركين
    </td>
    
    <td>
      لا ينطبق
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/synthetic-audiences-vs-foundation-models">
        Named foundation models
      </a>
    </td>
    
    <td>
      الأشخاص الـ 22 والإجابات الـ 66 أنفسهم، ليس فوجا جديدا
    </td>
    
    <td>
      +25.49 نقطة مقارنة بـ GPT-5.4؛ و+30.05 مقارنة بـ Claude Sonnet 5
    </td>
    
    <td>
      لا ينطبق
    </td>
  </tr>
  
  <tr>
    <td>
      <a href="/research/spark-effect-creative-diversity-multi-agent-ai">
        Spark creative diversity
      </a>
    </td>
    
    <td>
      سبع مهام إبداعية
    </td>
    
    <td>
      متوسط تنوع 7.90/10 مقابل خط أساس منتظم قدره 3.14/10
    </td>
    
    <td>
      لا ينطبق
    </td>
  </tr>
</tbody>
</table>

تقيم دراسة Spark تنوع الأفكار، وليس التوافق مع استطلاع تمثيلي أو التنبؤ بالأداء الإعلاني الحقيقي. وتعتمد مقارنات المقابلات على محكمين آليين، وليس على نسبة مئوية للأشخاص الذين جرت محاكاتهم بدقة.

## أين كان سياق المشاركين مفيدا

قيّمت الاختبارات النوعية الأصلية الإجابات البشرية اللاحقة التي حُجبت عن مرحلة التوليد. وفي مقارنة PRISM Alignment، حققت عقول Minds الكاملة معدل فوز أعمى بلغ 32.6%، مقارنة بـ 25.7% للموجهات الديموغرافية و20.5% للموجهات العامة. وتعد مجموعة بيانات PRISM هذه معيارا مرجعيا خارجيا مستقلا عن منهجية PRISM الخاصة بـ Minds.

استخدم التأكيد المستقل للمقابلات مجموعتين عامتين من النصوص، و22 شخصا، و66 إجابة لاحقة. وأظهر التقرير تفوقا إيجابيا للملف التعريفي مع الاسترجاع مقارنة بالموجهات العامة عبر المجموعتين وتحت تقييم نسخة ثانية من نظام التحكيم. وتستكشف [مقارنة النماذج التأسيسية المحددة](/research/synthetic-audiences-vs-foundation-models) هذه الميزة مقارنة بإجابات GPT وClaude العامة. ولم تتلق خطوط الأساس تلك أي سجل تاريخي للمشاركين.

تركز هذه التجارب على ملاءمة المشارك، والأسباب، والدقة، ونبرة الصوت. ولا ينبغي دمج درجات التحكيم الخاصة بها مع النسب المئوية لتوزيع الاستطلاعات؛ فكلاهما يعتمد على الأدلة التي يتلقاها المستجيب الاصطناعي، كما لا تزال التقييمات النوعية بحاجة إلى تأكيد من مقيّمين بشريين مستقلين.

## حدود تعميم هذه الأدلة

شملت الحزمة الأصلية 1,881 مشاركا عبر معاييرها الاستقصائية والنوعية. أما التشغيل الإضافي الخاص بالطعام لـ 301 من عقول Minds، فله فوجه ومقامه المرجعي البشري الخاص به، ويجب أن يظلا منفصلين.

حُجبت الأهداف عن مدخلات وقت التشغيل في الاختبارات المسجلة. ومع ذلك، ربما ظهرت بيانات المصادر العامة أثناء التدريب المسبق للنماذج، وبالتالي لا يضمن الفصل في وقت التشغيل غياب أي تعرض مسبق بالكامل. كما جاءت نتائج الاستطلاعات الأصلية من أطر اختبار معزولة؛ ولذا فهي لا تثبت سلوكا متطابقا عبر كل إصدار من إصدارات المنتج. واستخدمت دراسة PISA الصياغة الأصلية باللغة الإنجليزية عبر دولها الخمس.

تقدم هذه النظرة العامة الأدلة المعتمدة المشمولة هنا، ولا تمثل إحصاء شاملا لكل تجربة أجرتها Minds. فالاختبارات الاستكشافية وغير الناجحة الأخرى تتطلب سياقها الخاص. وتكمن الفائدة العملية لهذه النتائج في اختيار الجمهور المناسب، وشكل الاستجابة، ومنهجية التحقق لسؤال محدد.

اقرأ [كيفية بناء لجان أبحاث Minds](/research/methodology) للتعرف على سير العمل، واستعن بـ [قائمة التحقق من الصحة](/research/synthetic-audiences-validation-checklist) عند اتخاذ القرار بشأن ما يمكن للنتيجة الاصطناعية دعمه.
