ANES 2024: シンセティック回答と事後実査回答の比較検証
ANESの選挙前後の実査データを活用し、マッチングされた300人を対象に事後28問の回答を検証。回答フォーマットとプロファイル接地(グラウンディング)の影響を個別に測定しました。
ANES 2024の比較検証において、プロファイル検索に基づく確率回答を用いた場合、全体近似率は91.67%、平均分布誤差は8.33パーセントポイントとなりました。測定された改善の中で最も顕著だったのは確率推定(probability elicitation)によるもので、一般的な確率回答は一般的な強制選択型と比較して誤差を12.47ポイント削減しました。
すでにモデルへ与えられた回答を再構築する比較とは異なり、この設計では選挙前の先行実査データをエビデンスとして活用し、モデルには伏せられた(held-out)選挙後の事後回答を評価対象としました。
縦断テスト
サンプルはマッチングされた回答者300名と事後の28項目で構成されています。実査の人間の正解データは推論実行時には除外され、評価前に候補群は固定されました。検証条件は、一般的な強制選択回答、一般的な確率回答、人口動態属性に基づく確率回答、そして検索されたプロファイル情報に基づく確率回答に分離されました。
事前のエビデンスは回答者に関するコンテキストを提供できますが、将来の回答そのものを知ることとは異なります。この時間的な分離があることで、先行する情報がその後のアンケート回答へとどれだけ有効に引き継がれるかを評価する有用なテストとなります。
分布の測定結果
項目平均絶対誤差
本研究で報告された結果です。表と考察では、研究範囲、比較基準、不確実性を明示しています。
- 一般的な強制選択22.782
- 一般的な確率回答10.312
- 人口動態属性に基づく確率回答8.263
- 検索プロファイルに基づく確率回答8.330
| 条件 | 項目平均絶対誤差 |
|---|---|
| 一般的な強制選択 | 22.782 pp |
| 一般的な確率回答 | 10.312 pp |
| 人口動態属性に基づく確率回答 | 8.263 pp |
| 検索プロファイルに基づく確率回答 | 8.330 pp |
最終的な近似率は100から8.33を差し引いた91.67%となります。これは個人の予測精度や選挙結果の予測ではなく、回答セルの平均分布誤差を表しています。
一般的な確率回答と一般的な強制選択の比較では、記録された改善幅は12.47パーセントポイントに達しました。この対比において、2ポイント以上悪化した評価項目は一つもありませんでした。したがって、回答フォーマットによる効果は特定の単一項目に限られたものではありません。
グラウンディングと集計は異なる課題
検索プロファイルを付与しても、人口動態属性に基づく確率プロンプトと比較して集計レベルの平均絶対誤差は改善しませんでした。記録された差分は誤差+0.046ポイントであり、信頼区間はゼロを跨いでいます。前述の記述テーブルでも同様に、人口動態属性の確率回答がわずかに優位を示しています。
プロファイル情報は個人のブライア・スコア(Brier score)と完全一致精度を適度に改善した一方で、母集団のキャリブレーションをわずかに悪化させました。これらの結果は両立し得ます。個人の回答を予測することと、オーディエンス全体の分布を再構築することは異なるターゲットだからです。都合の良い指標だけを抽出することは、本研究の意図を歪めることになります。
本実験の全体的な結果は複合的です。確率推定の有効性を裏付ける一方で、集計レベルにおけるプロファイルの主要な増分効果は未確認のままとなっています。
示唆と限界事項
シンセティック・オーディエンスを比較する前に、評価ターゲットをあらかじめ設定しておく必要があります。個人回答のタスクには個人の指標が求められ、オーディエンス分布のタスクには集計レベルのキャリブレーションが必要です。一方での優れたスコアが、もう一方の代替になることはありません。
本検証は構造化された選挙前のエビデンスを用いた独立したテスト環境で実施されたものであり、完全な学習済みプロダクション版のMindパイプラインではありません。評価対象となったサンプルおよび事後設問は、あらゆる政治的オーディエンスや調査設計に対する一般的な妥当性を証明するものではありません。また、実行時のホールドアウトは、モデルの事前学習における公開データへの接触可能性を完全に排除するものではありません。
GSSパイロットでは別の回答フォーマット比較を提供しています。CES研究では複数の質問形式へと調査範囲を拡張しています。エビデンス概要では、それぞれのスコアと適用範囲を区別して整理しています。


