ANES 2024: シンセティック回答と事後実査回答の比較検証
ANESの選挙前後の実査データを活用し、マッチングされた300人を対象に事後28問の回答を検証。回答フォーマットとプロファイル接地(グラウンディング)の影響を個別に測定しました。
合成回答者、ペルソナ条件付きAI、評価手法、シミュレートされたエビデンスの限界に関する Minds Research Lab の実験・ベンチマーク・技術論文。
ANESの選挙前後の実査データを活用し、マッチングされた300人を対象に事後28問の回答を検証。回答フォーマットとプロファイル接地(グラウンディング)の影響を個別に測定しました。
CESの比較検証では、マッチングされた300名の回答者を対象に、二値選択、順序尺度、複数選択からなる27問を評価し、集計レベルの適合度と個人レベルの予測を切り分けて検証しています。
ターゲット分離型のGSSパイロット検証において、360名および17問を対象に4つの回答条件を比較し、確率推定の効果とプロファイルの付加価値を検証します。
2つの公開面接コーパスを用い、簡潔なプロファイルと事前発言の検索が、実在する22人の参加者によるその後の66件の回答に対する再現性を向上させるかを検証しました。
5カ国を対象としたPISA比較検証。生徒600人とホールドアウトされた10問を評価し、加重分布誤差ならびに国や言語に関する明確な制約条件を提示します。
299人・869項目を対象とした比較検証により、グラウンディングされたMindsが参加者の価値観や根拠をより適切に反映するかを、ブラインド判定と明確なタスク境界のもとで測定します。
ホールドアウトしたインタビュー比較を通じ、参加者プロファイルと記憶メカニズムが、汎用的なGPT、Claude、Geminiのプロンプトと比べてどのような状況で合成回答を向上させるかを検証します。
利用可能なMindsの定性・定量リサーチ手法、必要な入力データ、バージョン管理されたパイプラインステージ、計算処理、生成されるアーティファクト、および適用限界に関する公開マップ。
5つの公開調査データセット(301体のMindによるZ世代の本番環境テストを含む)から明らかになった合成オーディエンスの精度と、プロファイル接地が効果を発揮する領域。
アウトカムブラインド(結果非開示)の検証において、301名の固定されたZ世代のMindsによる903件の回答と、公表されている英国Food Standards Agencyの調査分布を比較しました。その結果、総合近似度は93.99%に達しました。
Minds が合成オーディエンスの根拠として用いる公的統計・学術・業界ソースと、グラウンディングでの利用方法。
Minds が根拠ある AI ペルソナを再利用可能なオーディエンスにまとめ、コンセプト、メッセージ、ポジショニング、市場を素早く探索する方法。
オーディエンスの定義、グラウンディング、プロンプトの中立性、出力の検証、レポート作成、および追跡調査の証拠を網羅した、合成オーディエンスのための実用的な検証チェックリスト。
Mindsが再利用可能なAIペルソナグループを作成し、並行してシンセティックな回答を収集し、エビデンスを重視した調査ワークフローにどのように適合するかを解説します。
「Spark Effect」研究により、ペルソナを設定したAIエージェントは、均一な単一エージェントのベースラインと比較して、大幅に多様なクリエイティブ成果物を生み出すことが明らかになりました。