·Validation·Minds Team

ANES 2024 : comparaison entre réponses synthétiques et réponses humaines ultérieures

Une comparaison pré/post-électorale de l'ANES teste 300 individus appariés sur 28 réponses ultérieures, en isolant le format de réponse et le profilage des participants.

La comparaison ANES 2024 a atteint une approximation agrégée de 91.67 %, soit 8.33 points de pourcentage d'erreur moyenne de distribution, en s'appuyant sur des réponses probabilistes issues de profils récupérés. L'amélioration mesurée la plus nette provient de l'élicitation probabiliste : les réponses probabilistes génériques ont réduit l'erreur de 12.47 points par rapport aux choix forcés génériques.

Contrairement à une comparaison qui reconstruit des réponses déjà fournies à un modèle, ce protocole s'est appuyé sur des données pré-électorales antérieures des répondants pour évaluer des réponses post-électorales ultérieures tenues à l'écart.

Le test longitudinal

L'échantillon comprenait 300 répondants appariés et 28 items ultérieurs. Les cibles humaines ont été exclues de la génération à l'exécution et les candidats ont été scellés avant l'évaluation. Les conditions expérimentales distinguaient une réponse forcée générique, des probabilités génériques, des probabilités démographiques et des probabilités enrichies par des profils récupérés.

Des données antérieures peuvent fournir du contexte sur un répondant, mais cela ne revient pas à connaître sa réponse future. Cette séparation temporelle en fait un test pertinent pour déterminer si une information préalable se transfère à un questionnaire ultérieur.

Résultats de distribution

Erreur absolue moyenne par item

Résultats rapportés pour cette étude. Le tableau et la discussion précisent le périmètre, les références et l’incertitude.

  • Choix forcé générique22,782
  • Probabilité générique10,312
  • Probabilité démographique8,263
  • Probabilité avec profil récupéré8,330
0Points de pourcentage · plus bas est mieux30
ConditionErreur absolue moyenne par item
Choix forcé générique22.782 pp
Probabilité générique10.312 pp
Probabilité démographique8.263 pp
Probabilité avec profil récupéré8.330 pp

La transformation d'approximation finale est de 100 moins 8.33, ce qui donne 91.67 %. Elle décrit l'erreur moyenne de distribution par modalité de réponse, et non la précision prédictive individuelle ni une prévision des résultats électoraux.

Pour la comparaison entre probabilité générique et choix forcé générique, l'amélioration enregistrée a été de 12.47 points de pourcentage. Aucun item évalué n'a régressé de plus de deux points sur ce contraste. L'effet du format de réponse ne se limite donc pas à un item isolé.

Ancrage et agrégation : deux problématiques distinctes

Les profils récupérés n'ont pas amélioré l'erreur absolue moyenne agrégée par rapport aux invites de probabilités démographiques. La différence enregistrée est de +0.046 point d'erreur, avec un intervalle incluant zéro. Le tableau descriptif montre d'ailleurs la probabilité démographique légèrement en tête.

Les profils ont modestement amélioré le score de Brier individuel et l'exactitude stricte, tout en dégradant légèrement le calibrage à l'échelle de la population. Ces résultats peuvent tout à fait coexister : prédire la réponse d'un individu et reconstruire la distribution d'une audience constituent deux objectifs distincts. Ne retenir que la métrique favorable fausserait la portée de l'étude.

Le bilan global de l'expérience est nuancé. Il valide l'apport de l'élicitation probabiliste tout en laissant non confirmé le gain agrégé incrémental apporté par les profils.

Implications et limites

Les équipes doivent définir leur cible d'évaluation avant de comparer des audiences synthétiques. Une tâche de réponse individuelle exige des métriques individuelles ; une tâche de distribution d'audience nécessite un calibrage agrégé. Un bon résultat sur l'un ne peut compenser l'autre.

Il s'agissait d'un banc d'essai isolé utilisant des données pré-électorales structurées, et non du pipeline de production complet entraîné de Minds. L'échantillon évalué et les questions ultérieures n'établissent pas une validité générale pour chaque audience politique ou chaque instrument d'enquête. L'exclusion de données au moment de l'exécution n'exclut pas une exposition préalable à des données publiques lors de l'entraînement du modèle.

Le pilote GSS propose une autre comparaison de formats de réponse. L'étude CES étend l'instrument à plusieurs types de questions. La vue d'ensemble des données probantes maintient leurs scores et leurs périmètres bien distincts.

Données de référence

ANES 2024