---
title: "Le conditionnement par la personnalité rend les répondants synthétiques plus distinctifs"
description: "Dans un benchmark aveugle portant sur 299 profils britanniques et 869 cibles réservées, les Minds conditionnés par la personnalité ont été plus souvent choisis que les prompts génériques ou démographiques."
canonical_url: "https://getminds.ai/research/fr/personality-conditioned-synthetic-respondents-benchmark-2026"
last_updated: "2026-08-13T13:08:02.469Z"
---

# Le conditionnement par la personnalité rend les répondants synthétiques plus distinctifs

Les Minds conditionnés par la personnalité ont été choisis dans **32.57%** des comparaisons aveugles à longueur égalisée, devant le prompting démographique (**25.66%**) et générique (**20.48%**) ; **21.29%** étaient des égalités.

L'avantage principal n'était pas seulement de paraître humain, mais de ressembler à une personne **précise** : exprimer ses valeurs, apporter des détails pertinents et mieux différencier les individus. C'est la qualité recherchée lorsque l'étude synthétique explore la manière dont différents membres d'une audience peuvent formuler la même question.

<study-stats>



</study-stats>

## Pourquoi la personnalité compte

Les modèles génériques produisent des réponses plausibles. Les études de marché ont souvent besoin de davantage : des réponses qui reflètent des différences significatives de priorités, de préférences et de vision du monde.

Ce benchmark demande si un Mind complet—fondé sur la démographie et des éléments de personnalité autoécrits et autorisés—reproduit mieux une expression qualitative réservée que le même modèle sans contexte ou avec la seule démographie.

La cible était une ouverture de conversation rédigée par le participant, et non une distribution d'enquête ou une opinion objectivement « vraie ». Nous mesurons donc l'adéquation qualitative au profil.

## Benchmark aveugle à trois bras

Nous avons utilisé **299 profils britanniques** du [PRISM Alignment Dataset](https://github.com/HannahKirk/prism-alignment), figé à la révision `a9ec82149036374768f70e132a2369a750e06bbe`. L'ensemble évalué contenait **869 cibles réservées observées**.

<table>
<thead>
  <tr>
    <th>
      Bras
    </th>
    
    <th>
      Contexte participant
    </th>
    
    <th>
      Exécution
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Générique
    </td>
    
    <td>
      Aucun contexte
    </td>
    
    <td>
      Gemini 3.6 Flash direct
    </td>
  </tr>
  
  <tr>
    <td>
      Démographique
    </td>
    
    <td>
      Âge, genre, pays, emploi et études
    </td>
    
    <td>
      Gemini 3.6 Flash direct
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      Démographie plus valeurs, préférences, comportement souhaité de l'assistant et prompts d'entraînement autorisés
    </td>
    
    <td>
      API Panels de production avec persona, RAG et grounding web ; Gemini 3.6 Flash
    </td>
  </tr>
</tbody>
</table>

Les cibles et leurs dérivés étaient interdits dans le contexte de génération. Un unique juge aveugle Gemini 3.6 Flash voyait le profil, la référence humaine réservée et trois candidats anonymes.

Pour que la verbosité ne décide pas du résultat, chaque candidat était tronqué au nombre de mots de la référence humaine avant le jugement. Les 869 cibles ont reçu une évaluation complète à trois bras.

## Minds a été choisi le plus souvent

<table>
<thead>
  <tr>
    <th>
      Résultat
    </th>
    
    <th align="right">
      Générique
    </th>
    
    <th align="right">
      Démographique
    </th>
    
    <th align="right">
      Minds
    </th>
    
    <th align="right">
      Égalité
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Victoires
    </td>
    
    <td align="right">
      178
    </td>
    
    <td align="right">
      223
    </td>
    
    <td align="right">
      <strong>
        283
      </strong>
    </td>
    
    <td align="right">
      185
    </td>
  </tr>
  
  <tr>
    <td>
      Part des 869 items
    </td>
    
    <td align="right">
      20.48%
    </td>
    
    <td align="right">
      25.66%
    </td>
    
    <td align="right">
      <strong>
        32.57%
      </strong>
    </td>
    
    <td align="right">
      21.29%
    </td>
  </tr>
  
  <tr>
    <td>
      Composite de fidélité, 0–100
    </td>
    
    <td align="right">
      27.23
    </td>
    
    <td align="right">
      27.68
    </td>
    
    <td align="right">
      <strong>
        32.38
      </strong>
    </td>
    
    <td align="right">
      —
    </td>
  </tr>
</tbody>
</table>

L'avantage de Minds était de **+12.04 points de pourcentage** sur le prompting générique (IC 95% +7.13 à +17.00 ; `p < .001` ajusté FDR) et de **+6.69 points** sur le démographique (IC 95% +1.56 à +11.93 ; `p = .020` ajusté FDR).

## Le signal le plus fort : valeurs et spécificité

<table>
<thead>
  <tr>
    <th>
      Contexte
    </th>
    
    <th align="right">
      Générique
    </th>
    
    <th align="right">
      Démographique
    </th>
    
    <th align="right">
      Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Guidé par les valeurs
    </td>
    
    <td align="right">
      19.30%
    </td>
    
    <td align="right">
      11.58%
    </td>
    
    <td align="right">
      <strong>
        42.81%
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Guidé par la controverse
    </td>
    
    <td align="right">
      18.88%
    </td>
    
    <td align="right">
      34.97%
    </td>
    
    <td align="right">
      <strong>
        38.81%
      </strong>
    </td>
  </tr>
</tbody>
</table>

Minds a obtenu **36.88** sur valeurs/personnalité et **33.46** sur spécificité, contre 30.85 et 21.70 pour le générique, puis 31.85 et 23.36 pour le démographique. Son score de généricité était également plus bas—**63.63**, où plus bas est meilleur—que le générique (**73.53**) ou le démographique (**72.58**).

Les réponses se différenciaient davantage entre personnes. La similarité TF–IDF moyenne était de 0.0308 pour Minds, 0.0516 pour le démographique et 0.1108 pour le générique. Les références humaines restaient plus diverses à 0.0128, mais le conditionnement rapprochait nettement le modèle de ce profil.

## Un signal de cohorte utile

Les améliorations les plus cohérentes apparaissaient dans les cohortes plus âgées. Les 55–64 ans dépassaient les deux baselines sur le taux de victoire et le composite après correction. Les 65+ dépassaient clairement le générique, et les 45–54 ans amélioraient le composite face au démographique.

Ces résultats de sous-groupes restent exploratoires, mais suggèrent que des préférences et valeurs plus riches peuvent fournir davantage de signal au conditionnement par la personnalité.

## Des réponses plus riches, comparées équitablement

Les réponses complètes de Minds comptaient en moyenne **51.62 mots**, contre **7.86** pour le générique et **7.51** pour le démographique. L'égalisation de longueur garantissait que le détail supplémentaire ne gagnait pas simplement en occupant plus d'espace.

Dans la pratique, Minds peut produire un matériau plus riche pour l'exploration qualitative. L'étape produit suivante consiste à adapter la profondeur de réponse à la tâche. Les artefacts ne contiennent pas d'usage de tokens end-to-end comparable pour tous les bras et ne permettent donc pas de ratio monétaire.

## Comment interpréter les preuves

- **Un juge par item (n=1).** Un jugement aveugle Gemini 3.6 Flash, sans calibration humaine.
- **Une famille de modèles.** Les bras et le juge utilisaient finalement Gemini 3.6 Flash.
- **Une cible qualitative.** Le benchmark mesure l'adéquation à un texte humain réservé, pas la prévalence populationnelle ou le comportement d'achat.
- **Un système end-to-end.** Personnalité, retrieval, grounding et formatage ont été évalués ensemble.

La déduplication sémantique **n'a pas été isolée dans une ablation**. Le benchmark ne permet donc pas de dire si elle a aidé ou non et ne justifie pas de la supprimer.

Ces 869 items servent désormais au développement du produit. Toute future allégation de lancement exige un nouveau holdout intact, idéalement avec des juges répétés ou une calibration humaine.

## Ce que nous testerons ensuite

La prochaine ablation comparera 1. le comportement actuel en production, 2. des réponses limitées à une longueur humaine et 3. une longueur humaine plus un routage adaptatif qui applique la profondeur de personnalité là où elle apporte le plus de valeur.

## Ce que cela signifie pour la recherche synthétique

Le constat pratique est clair : **le conditionnement par la personnalité a produit des répondants qualitatifs plus distinctifs que le prompting générique ou démographique seul** dans ce benchmark aveugle.

Minds est ainsi particulièrement utile pour générer et éprouver des hypothèses d'audience, explorer différents cadres de valeurs et faire émerger le langage que des personnes différentes pourraient employer. Il complète les preuves humaines et offre aux équipes un point de départ plus différencié qu'une réponse générique.

## Citation suggérée

Minds Research Lab. « Le conditionnement par la personnalité rend les répondants synthétiques plus distinctifs. » 8 août 2026. [https://getminds.ai/research/fr/personality-conditioned-synthetic-respondents-benchmark-2026](https://getminds.ai/research/fr/personality-conditioned-synthetic-respondents-benchmark-2026)
