---
title: "Minds vs GPT-5.4 et Claude Sonnet 5 sur de vraies réponses d'entretiens"
description: "Un benchmark qualitatif en aveugle comparant les Minds fondés sur des preuves avec GPT-5.4 et Claude Sonnet 5 génériques sur des réponses d'entretiens humains réservées."
canonical_url: "https://getminds.ai/research/fr/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:49.222Z"
---

# Minds vs GPT-5.4 et Claude Sonnet 5 sur de vraies réponses d'entretiens

Ce qui rend un répondant synthétique utile n'est pas sa capacité à produire une citation plausible. C'est sa capacité à poursuivre la perspective d'une personne réelle lorsqu'on lui pose une nouvelle question.

Minds Research Lab l'a testé directement. Nous avons utilisé 66 réponses ultérieures réservées issues de 22 personnes réelles interrogées dans deux jeux de données qualitatifs publics et indépendants. Les Minds fondés sur des preuves ont été comparés à GPT-5.4 générique, Claude Sonnet 5, et à une réponse générique du même modèle.

Minds a surpassé GPT-5.4 de **25.49 points composites** et Claude Sonnet 5 de **30.05 points**. Un second évaluateur en aveugle a reproduit les deux résultats.

<study-stats>



</study-stats>

## Le benchmark

L'étude a utilisé deux corpus d'entretiens publiés indépendamment et sous licence ouverte :

- [Entretiens anonymisés sur l'insécurité alimentaire des réfugiés](https://doi.org/10.6084/m9.figshare.29318549.v1), publiés par des chercheurs de l'Université de l'Utah.
- [Transcriptions d'entretiens internationaux en odontologie laser](https://doi.org/10.6084/m9.figshare.28456946.v1), publiées par des chercheurs de l'Université de Khon Kaen.

Pour chaque participant, les éléments antérieurs pouvaient alimenter le répondant synthétique tandis que les réponses ultérieures étaient réservées pour l'évaluation. Les modèles ont reçu la même question d'entretien et la même instruction sur le format de réponse. Les modèles fondateurs génériques n'ont reçu aucune mémoire ni aucun profil de participant.

Toutes les candidates ont été générées avant que les réponses réservées ne soient utilisées pour la notation. Les étiquettes des candidates ont été randomisées afin que l'évaluateur ne puisse pas savoir quel modèle avait produit quelle réponse.

## Résultats

<table>
<thead>
  <tr>
    <th>
      Candidate
    </th>
    
    <th align="right">
      Score composite
    </th>
    
    <th align="right">
      Taux de victoire
    </th>
    
    <th align="right">
      Différence par rapport à Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Réponse générique du même modèle
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

L'intervalle à 95 % regroupé par participant était de **+15.99 à +34.56** par rapport à GPT-5.4 et de **+21.86 à +38.12** par rapport à Claude Sonnet 5. Les deux corpus d'entretiens étaient positifs de manière indépendante.

Une seconde version de l'évaluateur a reproduit des gains de **+26.13** et **+30.68** points. Les deux juges étaient d'accord sur la candidate gagnante pour 81.8 % des réponses individuelles.

## Là où Minds a progressé

La grille d'évaluation a mesuré plus que la fluidité de surface. Elle a comparé chaque candidate avec la réponse ultérieure réelle de la personne sur les aspects suivants :

- Alignement sémantique
- Point de vue et valeurs
- Thèmes et arguments
- Spécificité
- Voix et style
- Ajustement de la longueur
- Caractère générique
- Faits personnels non étayés

Les avantages les plus marqués de Minds sont apparus dans l'alignement sémantique, le point de vue, les arguments, la spécificité et la présence d'une voix reconnaissable. En d'autres termes, Minds ne semblait pas simplement plus soigné. Il était plus à même de préserver ce qui importait à cette personne, la manière dont elle l'expliquait et les détails qu'elle utilisait naturellement.

Cet avantage n'était pas un artefact lié à la longueur. Les réponses candidates comptaient en moyenne environ 52 à 60 mots, toutes conditions confondues.

## Pourquoi cela diffère du fait de demander à ChatGPT d'agir comme un persona

Un modèle générique est extrêmement performant, mais la question seule ne contient pas l'historique de la personne. Il doit produire une réponse plausible pour quelqu'un dans l'abstrait.

Un Mind est conçu pour maintenir un participant de recherche persistant. Il peut transmettre des connaissances validées, un contexte de recherche antérieur et un point de vue différencié au fil de nouvelles questions. Cela permet à un modèle plus petit ou économique de surpasser un modèle générique beaucoup plus grand lorsque la tâche dépend de la connaissance de la personne plutôt que de la connaissance du monde.

C'est la thèse centrale de Minds sous une forme mesurable : **la profondeur de la personnalité et la mémoire pertinente peuvent importer plus que l'échelle brute du modèle fondateur.**

## Validation qualitative complémentaire

Le même programme de recherche plus large a également testé :

- [PRISM](https://arxiv.org/abs/2404.16019), en utilisant 299 participants intacts et 869 réponses humaines éligibles sur des valeurs, des sujets controversés et des invites non guidées.
- La [collection d'histoires orales de la NASA](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/), en utilisant des réponses ultérieures pour tester la continuité au travers d'entretiens professionnels au long cours.
- Un échantillon réservé distinct de 21 personnes formant une cohorte linguistique issue du corpus d'entretiens sur les réfugiés.

Sur l'ensemble de PRISM, les profils complets de Minds ont obtenu un score supérieur d'environ **10 à 12 points** par rapport aux incitations génériques et démographiques. Dans l'échantillon réservé de la cohorte linguistique distincte, la condition Mind s'est améliorée de **20.77 points** par rapport aux réponses génériques globales.

## Ce que cela signifie pour la recherche client

Les modèles fondateurs génériques sont utiles pour imaginer des réactions plausibles. Minds est conçu selon un standard différent : préserver des participants différenciés tout au long d'une étude.

Cela rend Minds particulièrement pertinent pour les entretiens exploratoires, les réactions à des concepts, le test de messages, la découverte d'objections, la recherche sur les comités d'achat, le suivi basé sur des personas et la transformation d'archives de recherche existantes en une audience interactive.

Le résultat sur les modèles désignés couvre les sources d'entretiens et les versions de modèles testées. Minds Research Lab continue d'étendre le benchmark à travers différents domaines, langues et formes de questions tout en maintenant la comparaison centrale ancrée dans de vraies réponses humaines.

Pour les preuves quantitatives, consultez [Benchmarks de sondage réels](/research/survey-approximation-benchmarks-2026). Pour le programme complet, consultez [Benchmark de recherche Minds 2026](/research/real-world-validation-benchmarks-2026).

## Sources publiques du benchmark

- [Transcriptions d'entretiens sur les réfugiés en Utah](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [Transcriptions d'odontologie laser internationale](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [Jeu de données d'alignement PRISM](https://arxiv.org/abs/2404.16019)
- [Histoires orales de la NASA](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## Citation suggérée

Minds Research Lab. « Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers. » 11 août 2026. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
