PISA 2022 : adéquation des sondages synthétiques sur cinq pays
Une comparaison PISA sur cinq pays évalue 600 élèves et dix questions réservées, mesurant les erreurs de distribution pondérée avec des limites géographiques et linguistiques explicites.
La comparaison PISA 2022 a atteint une approximation globale de 93.80% en utilisant des réponses probabilistes basées sur des profils compacts. L'erreur de distribution moyenne pondérée s'est établie à 6.20 points de pourcentage sur dix questions réservées auprès de 600 élèves répartis dans cinq pays.
Le résultat positif et reproductible concerne le format de réponse. Les probabilités génériques ont réduit l'erreur pondérée de 14.86 points par rapport aux choix forcés génériques, avec des effets positifs dans chaque pays et chaque famille de questions évalués.
La comparaison internationale
L'échantillon comprenait 120 élèves pour chacun des pays suivants : Royaume-Uni, Allemagne, Japon, Mexique et États-Unis. Dix questions couvraient cinq familles de questions. Les conditions ont comparé le choix forcé générique, la probabilité générique, la probabilité pays et démographie, ainsi que la probabilité avec profil compact.
Le test a utilisé la formulation originale en anglais pour l'ensemble des pays. Il a évalué le contexte national, et non la performance de cinq questionnaires traduits en langues locales. Les résultats des évaluations humaines ont été exclus des données fournies au modèle lors de l'exécution.
Résultats de distribution pondérée
Erreur absolue moyenne pondérée
Résultats rapportés pour cette étude. Le tableau et la discussion précisent le périmètre, les références et l’incertitude.
- Choix forcé générique22,29
- Probabilité générique7,42
- Probabilité pays et démographie6,59
- Probabilité avec profil compact6,20
| Condition | Erreur absolue moyenne pondérée |
|---|---|
| Choix forcé générique | 22.29 pp |
| Probabilité générique | 7.42 pp |
| Probabilité pays et démographie | 6.59 pp |
| Probabilité avec profil compact | 6.20 pp |
L'approximation est calculée comme 100 moins l'erreur absolue moyenne pondérée en points de pourcentage. Le résultat de 93.80% est une transformation de l'erreur de 6.20 points, et non l'affirmation que 93.80% des élèves ont été prédits individuellement de manière exacte.
Le gain pondéré enregistré pour la méthode probabiliste était de 14.8631 points, arrondi à 14.86, avec un intervalle à 95% allant de 8.78 à 18.96. Ce contraste concerne le recueil de probabilités par rapport aux réponses forcées dans la condition de modèle générique. Il ne doit pas être interprété comme une surperformance des profils Minds de cet ordre par rapport à un autre modèle de fondation.
La couverture géographique ne garantit pas la valeur universelle des profils
Le profil compact présentait un léger avantage descriptif par rapport aux seules données géographiques et démographiques. Le gain enregistré était de 0.40 point, avec un intervalle de -0.53 à +1.47, ce qui rend l'effet global incrémental non concluant.
La condition avec profil n'a pas franchi son critère de validation par pays et par famille de questions, et a dégradé le score de Brier individuel ainsi que la précision exacte par rapport aux variables démographiques. L'étude présente donc un bilan mitigé malgré le résultat positif obtenu sur l'élicitation probabiliste.
Cette nuance est essentielle dans l'interprétation d'un résultat international. Une moyenne pondérée favorable n'implique pas qu'un profil plus détaillé améliore les résultats pour chaque pays ou chaque famille de questions.
Champ d'application de ces résultats
Cette expérience confirme l'intérêt de conserver l'incertitude dans les réponses synthétiques lorsque la cible est une distribution. La cohérence observée à l'échelle des pays renforce la portée de ce constat sur le format de réponse, au-delà d'un jeu de données national unique.
Elle ne produit pas d'estimations de population officielles de l'OCDE, ne valide pas l'ensemble des thématiques éducatives et ne démontre pas la précision du prompting multilingue. Ce résultat obtenu sur banc de test isolé ne garantit pas non plus une performance identique sur tous les parcours produit actuels. Enfin, l'exclusion des données cibles au moment de l'exécution ne permet pas d'exclure une exposition préalable à des données publiques lors du pré-entraînement du modèle.
Pour guider le choix d'un client, la question déterminante reste d'établir si l'instrument, l'audience, la langue et la méthode de scoring correspondent à l'usage envisagé. Ces écarts doivent être vérifiés avant de considérer un score de benchmark comme un résultat garanti.
La comparaison du questionnaire CES analyse plusieurs formats de réponse. L'étude de production sur la génération Z teste une autre audience directement dans le produit. La vue d'ensemble des données probantes distingue clairement les preuves internationales, produit et qualitatives.


