Entretiens tenus en réserve : quand la mémoire du participant fait la différence
Deux corpus publics d'entretiens vérifient si des profils compacts et la recherche d'éléments préalables améliorent la fidélité à 66 réponses ultérieures issues de 22 participants réels.
Un profil compact enrichi d'éléments pertinents extraits de l'historique a amélioré les scores d'adéquation aux participants par rapport à un prompting générique, lors d'une validation portant sur 22 personnes et 66 réponses d'entretiens tenues en réserve. Le gain enregistré, regroupé par participant, s'élève à 24.37 points composites, avec des avantages moyens positifs sur les deux corpus évalués.
La question était précise : un répondant synthétique ancré peut-il mieux refléter ce qu'une personne spécifique a dit par la suite, plutôt que de simplement produire une réponse plausible à une question d'entretien ?
Éléments antérieurs, réponses ultérieures
L'étude s'est appuyée sur deux corpus publics d'entretiens portant sur des praticiens en dentisterie laser et sur l'insécurité alimentaire chez les réfugiés. Les premiers extraits d'entretien ont fourni des profils compacts de participants et des éléments consultables. Trois réponses ultérieures par personne ont été tenues en réserve pour l'évaluation.
Les conditions testées sur un même modèle distinguaient le prompting générique, le contexte de rôle, le contexte de profil et le profil enrichi par la recherche d'informations (retrieval). Ces comparaisons permettent d'isoler la valeur d'une description générale de rôle de celle d'éléments spécifiques à chaque participant.
L'évaluation portait sur 66 réponses cibles, mais seulement 22 personnes. Les différentes réponses d'une même personne constituant des observations interdépendantes, le calcul de l'incertitude doit impérativement traiter chaque participant comme un groupe (cluster).
L'avantage de fidélité observé
Résultat composite
Résultats rapportés pour cette étude. Le tableau et la discussion précisent le périmètre, les références et l’incertitude.
- Profil compact avec retrieval, moyenne60,33
- Prompting générique, moyenne35,98
| Condition ou contraste | Résultat composite |
|---|---|
| Profil compact avec retrieval, moyenne | 60.33 |
| Prompting générique, moyenne | 35.98 |
| Gain enregistré par rapport au prompting générique | +24.37 points |
| Gain enregistré par rapport au contexte de rôle | +18.58 points |
| Gain enregistré par rapport au profil seul | +6.10 points |
Le contraste enregistré et regroupé par participant ne correspond pas à la simple soustraction de moyennes descriptives arrondies. Les points composites synthétisent la fidélité des réponses évaluée par des juges automatisés : ils ne constituent ni un pourcentage d'approximation, ni la précision d'une distribution d'enquête, ni un pourcentage d'individus correctement simulés.
L'avantage face au prompting générique s'est manifesté sur les deux corpus ainsi qu'avec une seconde version du juge. Cela confirme l'utilité d'éléments antérieurs pertinents pour ces questions d'entretien ultérieures, tout en laissant ouverte la question de l'ampleur de cet effet dans de nouveaux domaines.
Pourquoi la recherche d'informations joue un rôle clé ici
Un profil compact capture un contexte durable, mais une question ultérieure peut exiger une expérience passée ou une motivation bien précise. Le mécanisme de recherche documentaire permet d'injecter ces éléments dans la réponse sans forcer chaque détail enregistré à peser sur chaque réponse.
Le résultat concorde avec cette explication. Il ne démontre pas qu'une mémoire plus vaste est systématiquement bénéfique, pas plus qu'il n'isole l'effet universel d'une technique d'extraction particulière. Le périmètre de cette conclusion reste défini par le workflow évalué, le contexte autorisé et les questions tenues en réserve.
Limites et évaluation complémentaire sur modèles spécifiques
L'échantillon d'observation reste restreint et ne couvre que deux corpus. Certains entretiens sources ont été traduits en anglais, ce qui rend plus complexe l'évaluation du ton et de la formulation exacte. La notation a été réalisée par des juges automatisés et non par des évaluateurs humains indépendants : elle ne doit donc pas être présentée comme une fidélité certifiée par des humains.
La comparaison des modèles de fondation désignés a réutilisé ces mêmes 22 personnes et 66 réponses avec un ensemble différent de candidats et de méthodes d'évaluation comparative. Il s'agit d'une évaluation de suivi sur les mêmes données, et non d'une réplication sur une population indépendante. Ses scores composites ne doivent pas être combinés avec ceux de cette étude.
La comparaison d'alignement PRISM propose un jeu de données distinct sur l'adéquation aux participants, avec des contours de tâches différents. La vue d'ensemble des données probantes montre comment ces résultats qualitatifs complètent les données de distribution d'enquête sans pour autant s'y substituer.
Le profil compact approchait le processus d’entraînement et de récupération en production, sans le reproduire exactement.


