Held-Out-Interviews: Wann ein Teilnehmer-Gedächtnis hilft
Zwei öffentliche Interview-Korpora testen, ob kompakte Profile und abgerufene frühere Belege die Übereinstimmung mit 66 späteren Antworten von 22 realen Teilnehmern verbessern.
Ein kompaktes Profil mit relevanten abgerufenen Belegen verbesserte die Werte für den Teilnehmer-Fit gegenüber generischem Prompting in einer Validierung mit 22 Personen und 66 zurückgehaltenen Interview-Antworten. Der registrierte, nach Teilnehmern geclusterte Lift betrug 24.37 Composite-Punkte, mit positiven durchschnittlichen Vorteilen in beiden ausgewerteten Korpora.
Die Fragestellung war konkret: Kann ein fundierter synthetischer Befragter besser widerspiegeln, was eine bestimmte Person später geäußert hat, anstatt lediglich eine plausible Antwort auf eine Interviewfrage zu generieren?
Frühere Belege, spätere Antworten
Die Studie nutzte zwei öffentliche Interview-Korpora zu Anwendern in der Laserzahnheilkunde sowie zur Ernährungsunsicherheit von Geflüchteten. Früheres Interviewmaterial lieferte kompakte Teilnehmerprofile und abrufbare Belege. Drei spätere Antworten pro Person blieben für die Bewertung zurückgehalten.
Die Bedingungen innerhalb desselben Modells unterschieden zwischen generischem Prompting, Rollenkontext, Profilkontext sowie Profil plus Retrieval. Diese Vergleiche helfen dabei, den Wert einer allgemeinen Rollenbeschreibung vom Wert teilnehmerspezifischer Belege zu trennen.
Es gab 66 Zielantworten, aber nur 22 Personen. Mehrere Antworten einer Person sind zusammenhängende Beobachtungen; die Unsicherheit muss daher den Teilnehmer als Cluster berücksichtigen.
Der beobachtete Vorteil bei der Antworttreue
Composite-Ergebnis
Berichtete Ergebnisse dieser Studie. Tabelle und Diskussion erläutern Geltungsbereich, Baselines und Unsicherheit.
- Kompaktes Profil plus Retrieval, Mittelwert60,33
- Generisches Prompting, Mittelwert35,98
| Bedingung oder Kontrast | Composite-Ergebnis |
|---|---|
| Kompaktes Profil plus Retrieval, Mittelwert | 60.33 |
| Generisches Prompting, Mittelwert | 35.98 |
| Registrierter Lift gegenüber generischem Prompting | +24.37 Punkte |
| Registrierter Lift gegenüber Rollenkontext | +18.58 Punkte |
| Registrierter Lift gegenüber reinem Profilkontext | +6.10 Punkte |
Der registrierte, nach Teilnehmern geclusterte Kontrast ergibt sich nicht aus der einfachen Subtraktion gerundeter deskriptiver Mittelwerte. Composite-Punkte fassen die durch automatisierte Judges bewertete Antworttreue zusammen; sie sind kein Näherungsprozentsatz, keine Genauigkeit der Umfrageverteilung und kein Prozentsatz korrekt simulierter Individuen.
Der positive Vergleich gegenüber generischem Prompting zeigte sich in beiden Korpora und unter einer zweiten Judge-Version. Dies stützt den Nutzen relevanter früherer Belege für diese späteren Interviewfragen, lässt die Stärke des Effekts in neuen Bereichen jedoch offen.
Warum Retrieval hier eine Rolle spielt
Ein kompaktes Profil erfasst dauerhaften Kontext, doch eine spätere Frage erfordert möglicherweise eine ganz bestimmte frühere Erfahrung oder Begründung. Retrieval kann diesen Beleg in die Antwort einbringen, ohne dass jedes aufgezeichnete Detail jede einzelne Antwort beeinflussen muss.
Das Ergebnis steht im Einklang mit dieser Erklärung. Es belegt nicht, dass mehr Gedächtnis immer hilft, noch isoliert es einen universellen Effekt einer bestimmten Retrieval-Technik. Der untersuchte Workflow, der zulässige Kontext und die zurückgehaltenen Fragen definieren den Gültigkeitsbereich dieser Aussage.
Grenzen und das Follow-up mit namentlich genannten Modellen
Die Datenbasis ist klein und umfasst lediglich zwei Korpora. Einige Quellinterviews wurden ins Englische übersetzt, was Urteile über Tonalität und den genauen Wortlaut erschwert. Das Scoring nutzte automatisierte Judges statt unabhängiger menschlicher Rater und sollte nicht als von Menschen verifizierte Treue dargestellt werden.
Der Vergleich namentlich genannter Basismodelle nutzte dieselben 22 Personen und 66 Antworten mit einem anderen Kandidatenset und Bewertungsvergleich erneut. Es handelt sich um eine Folgeauswertung auf derselben Datenbasis, nicht um eine unabhängige Populationsreplikation. Seine Composite-Werte sollten nicht mit den Werten dieser Studie zusammengeführt werden.
Der PRISM-Alignment-Vergleich liefert einen separaten Datensatz zum Teilnehmer-Fit und andere Aufgabenrahmen. Die Evidenzübersicht zeigt, wie diese qualitativen Ergebnisse Evidenz aus Umfrageverteilungen ergänzen, statt sie zu ersetzen.
Das kompakte Profil näherte den Trainings- und Retrieval-Workflow des Produkts an; es bildete ihn nicht exakt nach.


