·Validation·Minds Team

GSS 2024: 不確実性の保持が調査適合度を向上させる

ターゲット分離型のGSSパイロット検証において、360名および17問を対象に4つの回答条件を比較し、確率推定の効果とプロファイルの付加価値を検証します。

GSS 2024のパイロット検証では、構造化プロファイルを用いた確率回答において92.47%の集計近似度を達成しました。17問およびマッチングされた360名の回答者全体における平均分布誤差は7.53パーセントポイントでした。ここで得られた有用な知見は、単に最終スコアが高かったことにとどまりません。単一の選択肢を強制するのではなく確率を収集したことで、分布への適合度が大幅に向上した点にあります。

比較対象と検証設計

本評価では、実際のGSSにおける態度および行動への回答をホールドアウトターゲットとして使用しました。モデルに提供するコンテキストと回答形式を区別するため、4つの条件を設定しました: 一般プロンプト強制選択、一般プロンプト確率推定、属性付与確率推定、構造化プロファイル確率推定です。候補となる生成結果は、評価ターゲットが開示される前に確定・封印されました。

使用されたプロファイルには構造化された調査データが含まれており、本番環境のMind全体の表現ではありません。実験は隔離された検証ハーネス上で実施されました。得られた結果は検証された回答手法を支持するものであり、本番環境のあらゆるオーディエンスに対して同一の精度を保証するものではありません。

4つの条件における検証結果

項目別平均絶対誤差

本研究で報告された結果です。表と考察では、研究範囲、比較基準、不確実性を明示しています。

  • 一般プロンプト強制選択25.74
  • 一般プロンプト確率推定8.44
  • 属性付与確率推定7.67
  • 構造化プロファイル確率推定7.53
0パーセントポイント · 低いほど良い30
条件項目別平均絶対誤差
一般プロンプト強制選択25.74 pp
一般プロンプト確率推定8.44 pp
属性付与確率推定7.67 pp
構造化プロファイル確率推定7.53 pp

近似度は、100から平均絶対パーセントポイント誤差を引いた値です。算出された92.47%は回答分布の適合度を示すものであり、個々の回答者の選択が正しく予測された割合ではありません。選択肢の数や集計方法がこの指標に影響を与えます。

一般プロンプト強制選択に対する一般プロンプト確率推定の事前登録リサンプリング推定値は、16.51ポイントの誤差削減でした。これは報告されたブートストラップ推定値であり、丸められた記述統計テーブルの値の単純な引き算ではありません。この値は回答形式の比較のみを分離したものであり、プロファイルや基盤モデル自体の優位性を示す結果として解釈してはなりません。

プロファイル比較がもたらす示唆

構造化プロファイルは、属性付与確率推定に対して記述統計上のわずかな優位性を示しました。事前登録されたプロファイルのリフトは0.17ポイントで、95%信頼区間は-1.00から+1.31でした。この信頼区間はゼロを跨いでおり、プロファイル条件は昇格基準を満たしませんでした。したがって、確率推定が有用なポジティブな知見をもたらした一方で、本研究全体としては混在した結果となっています。

実務上の区別が重要です。確率収集によって分布適合度が向上したからといって、それ単体で詳細な人物背景の追加が有効であることを証明するわけではありません。グラウンディングの公平な比較を行うには、回答形式を一定に保つ必要があります。

実務チームが得られる実践的示唆

対象が調査回答の分布である場合、個々のシンセティック回答者を単一のカテゴリカル回答に丸めるよりも、不確実性を保持する方が有益な情報をもたらします。よりリッチなコンテキストの段階的な寄与度を明確にするためにも、評価設計にはマッチングされた一般プロンプト確率推定のベースラインと属性ベースラインの両方を含めるべきです。

本研究は、任意の顧客層に対する代表的な推定値、個人の正確な予測、あるいは新しい質問票に対する誤差の保証を確立するものではありません。また、実行時ターゲットを非公開にしていても、公開データがモデルの事前学習に含まれていなかったことを証明できるわけではありません。

エビデンス概要では、GSSを他の4つの調査比較と並べて掲載しています。ANES追跡調査では、先行する回答者データを用いてその後の回答を検証しています。本番環境Z世代比較では、別個の永続型Mindコホートを評価しています。

参照データ

GSS 2024