---
title: "المقابلات المحجوبة: متى تفيد ذاكرة المشارك"
description: "اختبار على مجموعتي مقابلات عامتين لمعرفة ما إذا كانت الملفات التعريفية الموجزة واسترجاع الأدلة السابقة يحسنان دقة مطابقة 66 إجابة لاحقة من 22 مشاركاً حقيقياً."
canonical_url: "https://getminds.ai/research/ar/held-out-interview-response-validation"
last_updated: "2026-09-08T05:57:52.883Z"
---

# المقابلات المحجوبة: متى تفيد ذاكرة المشارك

أظهر الملف التعريفي الموجز المدعوم بأدلة مسترجعة ذات صلة تحسناً في درجات مطابقة المشاركين مقارنة بالهندسة العامة للأوامر (generic prompting)، وذلك في تجربة تأكيدية شملت 22 شخصاً و66 إجابة محجوبة من مقابلات. بلغ الارتفاع المسجل والمجمع على مستوى المشاركين 24.37 نقطة مركبة، مع تسجيل فوارق إيجابية في المتوسط عبر كلا المجموعتين اللتين خضعتا للتقييم.

كان السؤال محدداً: هل يمكن لمستجيب اصطناعي مدعوم ببيانات واقعية أن يعكس بشكل أفضل ما قاله شخص معين لاحقاً، بدلاً من مجرد تقديم إجابة تبدو مقبولة على سؤال في مقابلة؟

## أدلة سابقة، وإجابات لاحقة

استندت الدراسة إلى مجموعتي مقابلات عامتين تتعلقان بممارسي طب الأسنان بالليزر والأمن الغذائي للاجئين. وفرت مواد المقابلات السابقة ملفات تعريفية موجزة للمشاركين وأدلة قابلة للاسترجاع. وتم حجب ثلاث إجابات لاحقة لكل شخص بهدف التقييم.

ميزت شروط الاختبار ضمن النموذج نفسه بين التوجيه العام، وسياق الدور، وسياق الملف التعريفي، والملف التعريفي المدعوم بالاسترجاع. تساعد هذه المقارنات في فصل القيمة الناتجة عن الوصف العام للدور عن القيمة الناتجة عن الأدلة الخاصة بكل مشارك.

تضمنت التجربة 66 إجابة مستهدفة، لكنها تعود إلى 22 شخصاً فقط. ونظراً لأن الإجابات المتعددة للشخص الواحد تمثل ملاحظات مترابطة، فإن حساب عدم اليقين الإحصائي يتطلب التعامل مع كل مشارك كوحدة مجمعة (cluster).

## ميزة الدقة المرصودة

<research-figure :labels="["ملف تعريفي موجز مع الاسترجاع، المتوسط","توجيه عام، المتوسط"]" figure="held-out-interview-response-validation" note="النتائج المبلغ عنها لهذه الدراسة. يوضح الجدول والنقاش نطاق الدراسة وخطوط المقارنة وعدم اليقين." title="النتيجة المركبة" unitLabel="الدرجة / 100">



</research-figure>

<table>
<thead>
  <tr>
    <th>
      الشرط أو المقارنة
    </th>
    
    <th align="right">
      النتيجة المركبة
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      ملف تعريفي موجز مع الاسترجاع، المتوسط
    </td>
    
    <td align="right">
      60.33
    </td>
  </tr>
  
  <tr>
    <td>
      توجيه عام، المتوسط
    </td>
    
    <td align="right">
      35.98
    </td>
  </tr>
  
  <tr>
    <td>
      الارتفاع المسجل مقارنة بالتوجيه العام
    </td>
    
    <td align="right">
      +24.37 نقطة
    </td>
  </tr>
  
  <tr>
    <td>
      الارتفاع المسجل مقارنة بسياق الدور
    </td>
    
    <td align="right">
      +18.58 نقطة
    </td>
  </tr>
  
  <tr>
    <td>
      الارتفاع المسجل مقارنة بسياق الملف التعريفي فقط
    </td>
    
    <td align="right">
      +6.10 نقطة
    </td>
  </tr>
</tbody>
</table>

التباين المسجل والمجمع على مستوى المشاركين لا ينتج عن مجرد طرح المتوسطات الوصفية المقربة. تلخص النقاط المركبة دقة الاستجابة وفقاً لتقييم الحكام الآليين، وهي لا تمثل نسبة مئوية تقريبية، أو دقة لتوزيع استطلاعي، أو نسبة مئوية للأفراد الذين تمت محاكاتهم بشكل صحيح.

ظهر التفوق الإيجابي مقارنة بالتوجيه العام في كلا المجموعتين ومع استخدام نسخة تحكيم ثانية. يدعم هذا فائدة الأدلة السابقة ذات الصلة في الإجابة عن أسئلة المقابلات اللاحقة هذه، مع إبقاء مدى قوة هذا التأثير في مجالات جديدة مسألة مفتوحة للبحث.

## لماذا يعد الاسترجاع مهماً هنا

يلتقط الملف التعريفي الموجز السياق الدائم والمستمر، لكن السؤال اللاحق قد يتطلب تجربة أو سبباً محدداً ورد في وقت سابق. يتيح الاسترجاع إدخال هذا الدليل في الإجابة دون اشتراط أن تؤثر كل تفصيلة مسجلة على كل إجابة.

تتوافق النتيجة مع هذا التفسير. إلا أنها لا تثبت أن زيادة الذاكرة تفيد دائماً، كما لا تعزل أثراً عاماً لأي تقنية استرجاع بعينها. يظل هذا الاستنتاج محكوماً بإجراءات العمل التي خضعت للتقييم، والسياق المسموح به، والأسئلة المحجوبة.

## الحدود والمتابعة عبر النماذج التأسيسية المسماة

مجموعة الأدلة صغيرة وتقتصر على مجموعتي بيانات فقط. كما أن بعض المقابلات الأصلية تُرجمت إلى الإنجليزية، مما يزيد من صعوبة الحكم على النبرة التعبيرية وصياغة الكلمات بدقة. واعتمد التقييم على حكام آليين وليس على مقيمين بشريين مستقلين، ولا ينبغي تقديم النتائج على أنها دقة معتمدة من البشر.

أعادت [مقارنة النماذج التأسيسية المسماة](/research/synthetic-audiences-vs-foundation-models) استخدام هؤلاء المشاركين الـ 22 والإجابات الـ 66 نفسها مع مجموعة مرشحة مختلفة ومقارنة تقييم مغايرة. إنها تمثل تقييماً تتبعياً للأدلة ذاتها، وليست تكراراً مستقلاً على مجتمع جديد. وعليه، لا ينبغي دمج درجاتها المركبة مع درجات هذه الدراسة.

تقدم [مقارنة محاذاة PRISM](/research/prism-alignment-participant-fit-validation) مجموعة بيانات منفصلة لمطابقة المشاركين مع حدود مهام مختلفة. بينما توضح [نظرة عامة على الأدلة](/research/synthetic-audiences-reality-benchmark-2026) كيف تكمل هذه النتائج النوعية أدلة توزيع الاستطلاعات بدلاً من أن تحل محلها.

مثّل الملف المختصر سير عمل التدريب والاسترجاع في المنتج بصورة تقريبية، ولم يُعِد إنتاجه بشكل مطابق.

## البيانات المرجعية

[De-identified, English Transcripts of 36 interviews](https://figshare.com/articles/dataset/De-identified_English_Transcripts_of_36_interviews/29318549)

[Transcription Data](https://figshare.com/articles/dataset/Transcription_Data/28456946)

[CC BY 4.0](https://creativecommons.org/licenses/by/4.0/)
