·Validation·Minds Team

CES 2024 : ajustement d'enquête sur plusieurs formats de questions

Une comparaison CES évalue 300 répondants appariés sur 27 questions binaires, ordinales et à choix multiples, en séparant ajustement agrégé et prédiction individuelle.

Le test CES 2024 a atteint 95.28% d'approximation agrégée avec des réponses probabilistes basées sur les profils, soit 4.72 points de pourcentage d'erreur moyenne de distribution. Sur l'ensemble de la comparaison des formats de réponse, l'élicitation probabiliste a réduit l'erreur d'une estimation bootstrap enregistrée de 19.72 points par rapport aux réponses forcées.

Cette étude étend les preuves empiriques au-delà d'un format de question unique. Elle montre également pourquoi un score final d'approximation doit toujours s'accompagner de critères de référence appariés.

Le questionnaire évalué

La comparaison a mobilisé 300 répondants CES appariés et 27 questions exclues du test : 15 questions ordinales, 10 binaires et deux batteries de questions à choix multiples. Les informations préalables sur les répondants ont fourni le contexte ; les réponses d'évaluation ont été strictement exclues de la génération.

Les quatre conditions testées étaient le choix forcé générique, les probabilités ou marginales génériques, les probabilités démographiques et les probabilités sur profil complet. Les options à choix multiples nécessitent des probabilités marginales car un répondant peut sélectionner plusieurs options. Leur interprétation diffère de celle d'un vecteur probabiliste à choix unique.

Les distributions mesurées

Erreur absolue moyenne par item

Résultats rapportés pour cette étude. Le tableau et la discussion précisent le périmètre, les références et l’incertitude.

  • Choix forcé générique26,927
  • Probabilités ou marginales génériques7,036
  • Probabilités démographiques4,563
  • Probabilités sur profil complet4,720
0Points de pourcentage · plus bas est mieux30
ConditionErreur absolue moyenne par item
Choix forcé générique26.927 pp
Probabilités ou marginales génériques7.036 pp
Probabilités démographiques4.563 pp
Probabilités sur profil complet4.720 pp

L'approximation correspond à 100 moins l'erreur absolue moyenne en points de pourcentage. Le chiffre de 95.28% décrit donc l'ajustement moyen de distribution sur les questions évaluées. Il ne s'agit pas d'un pourcentage d'individus simulés avec exactitude.

Le gain probabiliste bootstrap enregistré s'élève à 19.719 points, arrondi à 19.72. Le contraste ponctuel rapporté était de 19.892 points, avec un intervalle à 95% compris entre 16.257 et 23.401. La synthèse bootstrap et les moyennes de conditions affichées reposent sur des résumés statistiques et des arrondis distincts ; ils ne doivent pas être substitués l'un à l'autre sans distinction.

Ce que les profils enrichis ont amélioré - et ce qu'ils n'ont pas amélioré

Les profils complets ont amélioré les résultats par rapport au prompting probabiliste générique, mais n'ont pas surpassé les probabilités démographiques appariées sur la métrique agrégée principale. Le gain des profils par rapport aux données démographiques s'est établi à -0.157 point et son intervalle incluait zéro.

L'exactitude individuelle a progressé grâce au contexte de profil, tandis que l'erreur agrégée était légèrement supérieure à celle obtenue avec les données démographiques. Le résultat est donc mitigé, avec un constat marqué sur le format de réponse, mais sans avantage agrégé confirmé de la condition sur profil complet par rapport à la condition démographique.

Seules deux batteries à choix multiples étaient disponibles. Il s'agit d'un constat tiré d'un questionnaire mixte, et non d'une validation universelle du calibrage des choix multiples à travers tous les domaines et instruments.

Application des enseignements

Pour estimer des distributions, la collecte et l'agrégation des réponses doivent être intégrées comme des composantes explicites du protocole d'étude. Une référence catégorielle forcée ne permet pas d'isoler la valeur ajoutée des profils si l'on autorise l'échantillon enrichi à renvoyer des probabilités.

Une comparaison doit également préciser si son objectif est l'ajustement populationnel à l'échelle de l'item ou la prédiction individuelle. Ajouter du contexte n'améliore pas automatiquement les deux aspects. L'échantillon testé, la configuration du modèle et le questionnaire définissent le périmètre de validité des conclusions.

Ce test réalisé en environnement isolé ne garantit pas le comportement actuel du produit ni la représentativité des estimations pour de nouveaux publics clients. Une exposition préalable aux données de pré-entraînement publiques demeure possible, même avec une séparation des cibles au moment de l'exécution.

L'étude longitudinale ANES examine la même distinction entre niveau agrégé et niveau individuel. La comparaison PISA y ajoute un cadre couvrant cinq pays. La synthèse des données relie ces résultats sans les amalgamer en un score unique.

Données de référence

CES 2024