合成オーディエンスの精度を現実データで検証した結果
5つの公開調査データセット(301体のMindによるZ世代の本番環境テストを含む)から明らかになった合成オーディエンスの精度と、プロファイル接地が効果を発揮する領域。
合成リサーチには、外部のリファレンス、すなわち実在する人間からの回答が不可欠です。初期のリサーチ検証群では、合成回答を4つの公開調査データセットおよび2つの定性ベンチマークと比較しました。その後のFood and You本番環境テストでは、同一の問いに対する実践的な検証を追加しました。持続的なMindで構成されたオーディエンスは、実際の調査の回答分布をどれほど忠実に再現できるのでしょうか。
検証結果は、2つの異なる価値の源泉を示しています。不確実性を保持することで、調査分布の推定精度が向上します。また、回答が個人の経験、理由、価値観に依存する場合、参加者プロファイルと関連する記憶がさらなる価値をもたらします。それぞれの利点はタスクによって異なります。
選定された調査再現研究
平均分布誤差
質問票とコホートは異なり、PISA は加重結果です。誤差は低いほど良く、単一の精度スコアに統合できません。
- GSS 20247.53
- ANES 20248.33
- CES 20244.72
- PISA 20226.20
- Food and You 2, Wave 106.01
| 再現研究 | 公開された元データセット | 結果 |
|---|---|---|
| GSS 2024 調査再現 | GSS 2024 | 近似度92.47% · 平均誤差7.53 pp |
| ANES 2024 縦断再現 | ANES 2024 Time Series Study | 近似度91.67% · 平均誤差8.33 pp |
| CES 2024 事前・事後再現 | 2024 Canadian Election Study | 近似度95.28% · 平均誤差4.72 pp |
| PISA 2022 国際再現 | PISA 2022 Database | 近似度93.80% · 加重平均誤差6.20 pp |
| Food and You 2 本番環境再現 | Food and You 2, Wave 10 | 近似度93.99% · 平均誤差6.01 pp · Pearson 0.804 · Spearman 0.834 |
全体近似度とは、100から平均絶対パーセンテージポイント誤差を引いた値を意味します。これは回答分布間の乖離を測定するものであり、同等の割合の個人が正しく予測されたことを意味するわけではありません。各研究では異なる調査設計や集計詳細(ウェイト調整されたPISAの結果を含む)が用いられているため、これらの行を単純に平均して単一の精度スコアとすべきではありません。
最初の4行は、初期の独立した調査実験によるものです。5行目は、既存の固定コホートに対して後から実施されたプロダクト実行です。これを含めることでエビデンスの全体像を拡張していますが、そのコホートでの再実行を新たな独立した母集団研究として扱うものではありません。
Z世代: プロダクトを通じた実際のアンケート検証
英国食品基準庁(UK Food Standards Agency)のFood and You 2調査では、若年層が朝食、昼食、夕食において外食やテイクアウトを利用する頻度を質問しました。本番環境での比較検証では、16歳から24歳の持続的なMind 301体に対して同じ3つの質問を行い、得られた分布を公開されている若年層の調査結果と比較しました。評価対象となった各項目の人間の回答母数は257人でした。
計画された全903件の回答が完了しました。21個の回答選択肢セル全体において、平均絶対誤差は6.01パーセンテージポイント、平均分布重複率は78.98%でした。これらは異なる特性を表しています。近似度変換はセルの平均誤差を要約する一方、重複率は分布間で共有されている確率質量の割合を示します。
同一のコホートおよび調査項目を用いた8月18日の実行では、8月9日の結果から改善が見られ、誤差は7.33ポイントから6.01ポイントへと低下し、相対的に18.0%減少しました。すべての質問項目で改善が確認されました。この比較は、同時並行の無作為化比較ではなく、過去の対照データを用いたプロダクトのリグレッションテストです。
ベースラインの文脈が重要です。固定された一般的な確率プロンプトでは6.68ポイントの誤差が、等確率の帰無モデルでは同じセルで7.00ポイントの誤差が記録されました。本番環境の結果は記述統計的には優れていましたが、これらのベースラインは同時に再実行されたものではありません。したがって、近似度スケールにおける90点台というスコア単体をもって、大きな優位性があると解釈すべきではありません。
Z世代の食品調査に関する詳細記事では、オーディエンス、アンケート、データの出所、質問ごとの結果を解説しています。英国食品基準庁は公開リファレンスデータセットを提供した組織であり、本Minds研究への協賛、推奨、レビューは行っていません。
不確実性の保持が調査推計を改善した理由
初期の4つの調査実験において、確率回答は、単一回答を強制する場合と比較して分布誤差を12.47から19.72パーセンテージポイント低減させました。この改善は4つのデータセットすべてで確認されました。
確率回答は、カテゴリ選択では切り捨てられてしまう不確実性を保持します。オーディエンス全体で集計した際、これらの確率は、各合成回答者に単一の選択を強制するよりも忠実に母集団の分布を復元できます。
この結果は、回答の収集と集計に関するものです。同実験において、詳細なプロファイルがデモグラフィック確率プロンプトを一貫して上回ったわけではありません。比較の基準となるベースラインや回答形式は、最終的なスコアと同等に重要な意味を持ちます。
その他の選定された検証
これらの研究では異なる評価指標が用いられているため、近似度をパーセンテージで示すと誤解を招く恐れがあります。これらは調査エビデンスの精度範囲を拡大するというよりも、それを補完する位置づけにあります。
| 研究および詳細な結果 | 評価対象サンプル | 報告された結果 | 近似度 |
|---|---|---|---|
| PRISM Alignment | 299人の参加者、869項目 | 参加者適合における勝率32.6%(デモグラフィックプロンプトは25.7%、汎用プロンプトは20.5%) | 該当なし |
| 保留インタビュー | 22人、66回答、2つのコーパス | 汎用モデルに対する参加者クラスタリング推計値で+24.37総合ポイント | 該当なし |
| 主要基盤モデルとの比較 | 同一の22人および66回答(新規コホートではない) | GPT-5.4に対して+25.49ポイント、Claude Sonnet 5に対して+30.05ポイント | 該当なし |
| Sparkクリエイティブ多様性 | 7つのクリエイティブタスク | 一様ベースラインの3.14/10に対し、平均多様性7.90/10 | 該当なし |
Sparkはアイデアの多様性を評価するものであり、代表性のある調査との一致度や実際の広告成果の予測を評価するものではありません。インタビューの比較検証では自動評価モデルを採用しており、正しくシミュレートされた人間の割合を測定しているわけではありません。
参加者のコンテキストが効果を発揮した領域
初期の定性テストでは、生成時には除外されていた、その後の人間の回答を評価しました。PRISM Alignmentの比較において、完全なMindはブラインドテストで32.6%の勝率を記録し、デモグラフィックプロンプトの25.7%、汎用プロンプトの20.5%を上回りました。なお、このPRISMデータセットは外部のベンチマークであり、Minds独自のPRISMアプローチとは異なるものです。
独立したインタビュー検証では、2つの公開コーパス、22人の参加者、66件の後続回答を使用しました。その報告では、両方のコーパスにおいて、また第2の評価モデルバージョン下においても、汎用プロンプトに対するプロファイル+検索の優位性が確認されました。主要モデルとの比較では、汎用GPTおよびClaudeの回答を対象にその優位性を検証しています。それらのベースラインには参加者の履歴情報は与えられていません。
これらの実験は、参加者への適合度、回答の理由、具体性、語り口に関するものです。評価スコアを調査分布のパーセンテージと混同すべきではありません。いずれも合成回答者にどのようなエビデンスが与えられるかに依存しており、定性評価には引き続き独立した人間の評価者による確認が必要です。
エビデンスの適用範囲と限界
初期の検証スイートは、調査および定性ベンチマーク全体で1,881人の参加者で構成されていました。追加された301体のMindによる食品調査の実行には独自のコホートと人間の参照母数が存在するため、これらは区別して扱う必要があります。
報告されたテストでは、ターゲットとなるデータはランタイムの入力から除外されていました。ただし、公開データはモデルの事前学習に含まれていた可能性があるため、ランタイムでの分離によって過去の接触が一切なかったと断定することはできません。また、初期の調査結果は隔離された検証ハーネスで得られたものであり、すべてのプロダクトバージョンで同一の挙動を示すことを保証するものではありません。PISAでは、対象5カ国すべてで英語のマスター設問文が使用されました。
本稿の概要は、ここで対象とした承認済みのエビデンスを提示するものであり、Mindsが実施したすべての実験を網羅したものではありません。その他の探索的テストや不首尾に終わったテストには、それぞれの文脈が必要です。これらの知見の実践的な用途は、特定の問いに対して適切なオーディエンス、回答形式、および検証方法を選択することにあります。
ワークフローについてはMindsリサーチパネルの構築方法を参照し、合成結果が何を裏付けることができるかを判断する際は検証チェックリストをご活用ください。


