·Validation·Minds Team

Nous avons testé les audiences synthétiques face au réel

Ce que cinq jeux de données d'enquêtes publiques révèlent sur la précision des audiences synthétiques, dont un test en production auprès de 301 Minds de la Gen Z, et l'apport de l'ancrage des profils.

La recherche synthétique a besoin d'une référence externe : les réponses d'individus réels. Notre suite de recherche initiale a comparé les réponses synthétiques à quatre jeux de données d'enquêtes publiques et à deux benchmarks qualitatifs. Un test ultérieur en production sur Food and You a apporté un contrôle pratique sur cette même question : dans quelle mesure une audience de Minds persistants peut-elle reproduire les distributions de réponses d'une véritable enquête ?

Les résultats révèlent deux sources de valeur distinctes. Préserver l'incertitude affine les estimations des distributions d'enquête. Les profils de participants et les souvenirs pertinents apportent une valeur supplémentaire lorsqu'une réponse dépend des expériences, des motifs et des valeurs d'une personne. Leurs bénéfices varient selon la tâche.

Réplications d'enquêtes sélectionnées

Erreur moyenne de distribution

Questionnaires et cohortes différents ; PISA est pondéré. Une erreur plus faible est préférable. Ne pas regrouper ces résultats en un score de précision unique.

  • GSS 20247,53
  • ANES 20248,33
  • CES 20244,72
  • PISA 20226,20
  • Food and You 2, Wave 106,01
0Points de pourcentage · plus bas est mieux10
Étude répliquéeJeu de données source publicRésultat
Réplication de l'enquête GSS 2024GSS 202492.47% d'approximation · erreur moyenne de 7.53 pp
Réplication longitudinale ANES 2024ANES 2024 Time Series Study91.67% d'approximation · erreur moyenne de 8.33 pp
Réplication pré/post CES 20242024 Canadian Election Study95.28% d'approximation · erreur moyenne de 4.72 pp
Réplication internationale PISA 2022PISA 2022 Database93.80% d'approximation · erreur moyenne pondérée de 6.20 pp
Réplication en production de Food and You 2Food and You 2, Wave 1093.99% d'approximation · erreur moyenne de 6.01 pp · Pearson 0.804 · Spearman 0.834

L'approximation globale équivaut à 100 moins l'erreur absolue moyenne en points de pourcentage. Elle mesure l'écart entre les distributions de réponses. Elle ne signifie pas que le même pourcentage d'individus a été prédit avec exactitude. Les études emploient des instruments et des modalités d'agrégation différents, dont un résultat pondéré pour PISA ; ces lignes ne doivent pas être moyennées en un score unique de précision.

Les quatre premières lignes relèvent des expérimentations d'enquête initiales et isolées. La cinquième correspond à un test produit ultérieur sur une cohorte verrouillée existante. Son intégration enrichit l'ensemble des preuves sans transformer une réplication sur cette cohorte en une nouvelle étude démographique indépendante.

Gen Z : un questionnaire réel soumis au produit

L'enquête Food and You 2 de la Food Standards Agency britannique mesurait la fréquence à laquelle les jeunes mangent à l'extérieur ou achètent des plats à emporter pour le petit-déjeuner, le déjeuner et le dîner. La comparaison en production a posé ces trois mêmes questions à 301 Minds persistants âgés de 16 à 24 ans et a comparé les distributions obtenues aux résultats publiés pour les jeunes. La base de répondants humains comptait 257 personnes pour chaque item évalué.

L'ensemble des 903 réponses prévues a été recueilli. Sur 21 cellules d'options de réponse, l'erreur absolue moyenne s'est élevée à 6.01 points de pourcentage et le chevauchement moyen des distributions à 78.98%. Ces indicateurs décrivent des propriétés différentes : la transformation d'approximation résume l'erreur moyenne par cellule, tandis que le chevauchement reflète la masse de probabilité partagée par les distributions.

L'exécution du 18 août a progressé par rapport au résultat du 9 août sur la même cohorte et avec le même instrument : l'erreur est passée de 7.33 à 6.01 points, soit une réduction relative de 18.0%. Chaque question s'est améliorée. Cette comparaison constituait un test de régression produit avec contrôle historique, plutôt qu'une comparaison randomisée concurrente.

Le contexte de référence compte. Un prompt probabiliste générique figé a enregistré une erreur de 6.68 points et une hypothèse nulle d'équiprobabilité a obtenu 7.00 points sur les mêmes cellules. Le résultat en production était descriptivement meilleur, mais ces baselines n'ont pas été réexécutées simultanément. Un score supérieur à 90 sur l'échelle d'approximation ne doit donc pas être interprété à lui seul comme un avantage massif.

L'article complet sur l'enquête alimentaire Gen Z détaille l'audience, le questionnaire, la provenance et les résultats par question. La Food Standards Agency a fourni le jeu de données public de référence ; elle n'a ni commandité, ni approuvé, ni examiné cette étude Minds.

Pourquoi l'incertitude a amélioré les estimations d'enquête

Dans les quatre expérimentations d'enquête initiales, les réponses probabilistes ont réduit l'erreur de distribution de 12.47 à 19.72 points de pourcentage par rapport à un choix forcé à réponse unique. Cette amélioration s'est manifestée sur l'ensemble des quatre jeux de données.

Une réponse probabiliste préserve l'incertitude qu'un choix catégoriel écarte. Lorsqu'elles sont agrégées à l'échelle d'une audience, ces probabilités peuvent restituer une distribution de population plus fidèlement qu'un choix forcé unique par répondant synthétique.

Ce résultat concerne la collecte et l'agrégation des réponses. Ces mêmes expérimentations n'ont pas démontré que des profils détaillés surpassaient systématiquement des prompts probabilistes démographiques. La baseline de comparaison et le format de réponse comptent tout autant que le score final.

Autres validations sélectionnées

Ces études mesurent des variables différentes, de sorte qu'un pourcentage d'approximation serait trompeur. Elles complètent les éléments issus des enquêtes plutôt qu'elles n'en élargissent la plage de précision.

Étude et résultats détaillésÉchantillon évaluéRésultat rapportéApproximation
Alignement PRISM299 participants, 869 itemsTaux de victoire d'adéquation au participant de 32.6% ; 25.7% en démographique et 20.5% en génériqueNon applicable
Entretiens avec données réservées22 personnes, 66 réponses, deux corpus+24.37 points composites par rapport à une estimation générique regroupée par participantNon applicable
Modèles de fondation nommésMêmes 22 personnes et 66 réponses, pas une nouvelle cohorte+25.49 points face à GPT-5.4 ; +30.05 face à Claude Sonnet 5Non applicable
Diversité créative SparkSept tâches créativesDiversité moyenne de 7.90/10 contre une baseline uniforme de 3.14/10Non applicable

Spark évalue la diversité des idées, et non la concordance avec une enquête représentative ou la prédiction de performances publicitaires réelles. Les comparaisons d'entretiens reposent sur des juges automatisés, et non sur un pourcentage d'individus simulés correctement.

Là où le contexte des participants a fait la différence

Les tests qualitatifs initiaux ont évalué des réponses humaines ultérieures qui avaient été exclues de la génération. Dans la comparaison d'alignement PRISM, les Minds complets ont obtenu un taux de victoire à l'aveugle de 32.6%, contre 25.7% pour les prompts démographiques et 20.5% pour les prompts génériques. Ce jeu de données PRISM est un benchmark externe, distinct de la démarche PRISM propre à Minds.

La confirmation par entretiens indépendants a utilisé deux corpus publics, 22 personnes et 66 réponses ultérieures. Son rapport a constaté un avantage net de l'association profil et recherche d'information (retrieval) par rapport au prompting générique sur les deux corpus et sous une seconde version de juge. Une comparaison avec des modèles nommés explore cet avantage face à des réponses génériques de GPT et Claude. Ces baselines ne recevaient pas l'historique des participants.

Ces expérimentations portent sur l'adéquation au participant, les motifs, la précision et la voix. Leurs scores d'évaluation ne doivent pas être combinés avec les pourcentages de distribution d'enquête. L'un comme l'autre dépendent des éléments fournis au répondant synthétique, et les évaluations qualitatives nécessitent encore une confirmation par des évaluateurs humains indépendants.

La portée exacte des preuves

La suite initiale comprenait 1,881 participants répartis sur ses benchmarks d'enquête et qualitatifs. Le test alimentaire additionnel de 301 Minds dispose de sa propre cohorte et de son propre dénominateur de référence humain ; ils doivent rester distincts.

Les cibles étaient exclues des entrées au moment de l'exécution dans les tests rapportés. Les données de sources publiques ont toutefois pu figurer dans le pré-entraînement des modèles, si bien que la séparation au runtime ne permet pas d'établir l'absence de toute exposition préalable. Les résultats d'enquête initiaux provenaient également de bancs d'essai isolés ; ils ne garantissent pas un comportement identique d'une version de produit à l'autre. PISA a utilisé une formulation maîtresse en anglais pour ses cinq pays.

Cette vue d'ensemble présente les preuves validées couvertes ici, et non l'inventaire exhaustif de chaque test mené par Minds. D'autres tests exploratoires ou infructueux exigent leur propre contexte. L'utilité concrète de ces constats est d'aider à choisir une audience, un format de réponse et une méthode de validation adaptés à une question précise.

Découvrez comment les panels de recherche Minds sont construits pour en comprendre le fonctionnement, et consultez la checklist de validation pour déterminer ce qu'un résultat synthétique peut étayer.