PISA 2022:5カ国におけるシンセティック調査の適合性
5カ国を対象としたPISA比較検証。生徒600人とホールドアウトされた10問を評価し、加重分布誤差ならびに国や言語に関する明確な制約条件を提示します。
PISA 2022の比較検証において、コンパクトプロファイルによる確率回答を用いたところ、全体で93.80%の近似精度を達成しました。5カ国、600人の生徒から得られた10問のホールドアウト項目全体における加重平均分布誤差は6.20パーセントポイントでした。
再現性のある肯定的な知見は回答フォーマットに関するものでした。汎用的な確率回答は、汎用的な強制選択回答と比較して加重誤差を14.86ポイント削減し、評価対象となったすべての国および質問系統において良好な効果を示しました。
国際比較の枠組み
サンプルには、イギリス、ドイツ、日本、メキシコ、米国の各国からそれぞれ120人の生徒が含まれています。10問の質問が5つの質問系統をカバーしました。検証条件として、汎用強制選択、汎用確率、国・人口統計確率、そしてコンパクトプロファイル確率の各条件を比較しました。
テストではすべての国で英語のマスター文面を使用しました。これは5つのローカライズ言語によるアンケートの性能ではなく、各国の文脈を評価したものです。人間の評価結果はランタイム入力から除外(ホールドアウト)されました。
加重分布の結果
加重平均絶対誤差
本研究で報告された結果です。表と考察では、研究範囲、比較基準、不確実性を明示しています。
- 汎用強制選択22.29
- 汎用確率7.42
- 国および人口統計確率6.59
- コンパクトプロファイル確率6.20
| 条件 | 加重平均絶対誤差 |
|---|---|
| 汎用強制選択 | 22.29 pp |
| 汎用確率 | 7.42 pp |
| 国および人口統計確率 | 6.59 pp |
| コンパクトプロファイル確率 | 6.20 pp |
近似率は、100から加重平均絶対誤差(パーセントポイント)を引いた値です。93.80%という結果は6.20ポイントの誤差を変換した数値であり、生徒の93.80%が個別に正しく予測されたと主張するものではありません。
記録された加重確率リフトは14.8631ポイント(四捨五入して14.86ポイント)、95%信頼区間は8.78から18.96でした。この対比は、汎用モデル条件における確率回答の収集と強制回答との差に関するものです。Mindsのプロファイルが別の基盤モデルをそれだけの差で上回ったと説明してはなりません。
国のカバー範囲はプロファイルの普遍的な価値を意味しない
コンパクトプロファイルは、国および人口統計条件に対して記述統計上でわずかな優位性を示しました。記録されたリフトは0.40ポイント(信頼区間: -0.53〜+1.47)であり、全体的な増分効果は決定打に欠ける結果となりました。
プロファイル条件は、国別および質問系統別の昇格基準(プロモーションゲート)を満たせず、人口統計条件と比較して個別のブライアスコアおよび完全一致精度が悪化しました。したがって、本研究は確率引き出しにおいて肯定的な結果が得られたものの、全体としては賛否両論の混在した結果となっています。
国際的な結果を解釈する際、この境界線は重要です。加重平均が良好だからといって、プロファイルをより詳細にすることがすべての国の結果やあらゆる質問系統を改善することを意味するわけではありません。
本エビデンスの適用範囲
本実験は、ターゲットが分布である場合にシンセティック回答において不確実性を維持することの妥当性を支持しています。国レベルでの一貫性は、単一の国内データセットにとどまらない回答フォーマットに関する知見の裏付けとなります。
一方で、OECDの公式母集団推計を算出するものではなく、あらゆる教育トピックを検証するものでも、多言語プロンプトの精度を証明するものでもありません。また、隔離されたテスト環境での結果が、現在の製品のあらゆる実行パスで同一のパフォーマンスを保証するわけでもありません。ランタイムターゲットのホールドアウトを行っても、モデルの事前学習時における公開データへの接触を完全に排除することはできません。
顧客の意思決定においては、調査票、対象オーディエンス、言語、およびスコアリング手法が想定用途と一致しているかどうかが依然として問われます。ベンチマークスコアをそのまま期待される成果と見なす前に、これらの相違点を確認する必要があります。
CESアンケート比較では複数の回答形式を取り上げています。Z世代を対象とした製品検証では、製品を通じて別のオーディエンスをテストしています。エビデンス概要では、国際比較、製品検証、定性エビデンスを区別して整理しています。


