·Validation·Minds Team

GSS 2024 : préserver l'incertitude améliore l'ajustement aux enquêtes

Un pilote GSS avec séparation des cibles compare quatre conditions de réponse auprès de 360 personnes et 17 questions, distinguant l'élicitation des probabilités de la valeur du profil.

Le pilote GSS 2024 a atteint une approximation agrégée de 92.47% avec des réponses probabilistes issues de profils structurés. Son erreur de distribution moyenne était de 7.53 points de pourcentage sur 17 questions et 360 répondants appariés. Le résultat clé ne réside pas seulement dans ce score final élevé : recueillir des probabilités a nettement amélioré l'ajustement des distributions par rapport à l'obligation de fournir une réponse unique forcée.

Ce qui a été comparé

L'évaluation a utilisé des réponses réelles du GSS portant sur des attitudes et des comportements comme cibles retenues (held-out). Quatre conditions distinguaient le format de réponse du contexte fourni au modèle : choix forcé générique, probabilité générique, probabilité démographique et probabilité avec profil structuré. Les réponses candidates ont été scellées avant l'ouverture des cibles d'évaluation.

Le profil contenait des éléments d'enquête structurés, et non la représentation complète d'un Mind en production. L'expérience a été menée dans un environnement de test isolé. Son résultat valide la méthode de réponse testée, mais ne garantit pas une précision identique pour chaque audience en production.

Résultats selon les quatre conditions

Erreur absolue moyenne par item

Résultats rapportés pour cette étude. Le tableau et la discussion précisent le périmètre, les références et l’incertitude.

  • Choix forcé générique25,74
  • Probabilité générique8,44
  • Probabilité démographique7,67
  • Probabilité avec profil structuré7,53
0Points de pourcentage · plus bas est mieux30
ConditionErreur absolue moyenne par item
Choix forcé générique25.74 pp
Probabilité générique8.44 pp
Probabilité démographique7.67 pp
Probabilité avec profil structuré7.53 pp

L'approximation est calculée comme 100 moins l'erreur absolue moyenne en points de pourcentage. Le résultat de 92.47% résume l'ajustement de la distribution des réponses, et non le pourcentage de répondants individuels dont les choix ont été prédits avec exactitude. Le nombre d'options de réponse et la méthode d'agrégation influent sur cette mesure.

L'estimation par rééchantillonnage enregistrée pour la probabilité générique par rapport au choix forcé correspond à une réduction d'erreur de 16.51 points. Il s'agit de l'estimation bootstrap rapportée, et non d'une simple soustraction des valeurs descriptives arrondies du tableau. Elle isole la comparaison du format de réponse ; elle ne doit pas être interprétée comme une preuve de supériorité du profil ou du modèle de fondation.

Ce qu'apporte la comparaison des profils

Les profils structurés ont présenté un léger avantage descriptif par rapport à la probabilité démographique. Le gain enregistré pour le profil était de 0.17 point, avec un intervalle à 95% allant de -1.00 à +1.31. L'intervalle croisant zéro, la condition de profil n'a pas atteint son critère de validation. L'étude présente donc un bilan global mitigé, même si l'élicitation des probabilités a apporté un résultat positif probant.

Cette distinction pratique est essentielle. Un meilleur ajustement de distribution obtenu via la collecte de probabilités ne prouve pas en soi que l'ajout de détails biographiques apporte une plus-value. Une comparaison d'ancrage rigoureuse maintient le format de réponse constant.

Ce que les équipes peuvent en retenir

Lorsque la cible est une distribution de réponses d'enquête, préserver l'incertitude peut s'avérer plus instructif que de réduire chaque répondant synthétique à une réponse catégorielle unique. L'évaluation doit conserver à la fois une référence de probabilité générique appariée et une référence démographique afin de maintenir visible la contribution incrémentale d'un contexte plus riche.

Cette étude n'établit pas d'estimation représentative pour une audience client arbitraire, pas plus qu'une prédiction individuelle exacte ou une garantie d'erreur sur de nouveaux questionnaires. Le fait de masquer les cibles lors de l'exécution ne peut pas non plus prouver que des données publiques n'ont jamais figuré dans le pré-entraînement du modèle.

La synthèse des preuves situe le GSS aux côtés de quatre autres comparaisons d'enquêtes. Le suivi ANES teste des réponses ultérieures à partir de données antérieures sur les répondants. La comparaison Gen Z en production évalue une cohorte distincte de Minds persistants.

Données de référence

GSS 2024