·Research·Minds Team

シンセティックオーディエンスが一般的な基底モデルを上回る条件

ホールドアウトしたインタビュー比較を通じ、参加者プロファイルと記憶メカニズムが、汎用的なGPT、Claude、Geminiのプロンプトと比べてどのような状況で合成回答を向上させるかを検証します。

基底モデルは、インタビューの質問に対して一見もっともらしい回答を生成できます。しかし、特定の個人がどう答えるかを再現することは、はるかに具体的なタスクです。流暢で一般的な回答を生成するモデルの能力よりも、その人物の過去の経験、価値観、判断の根拠のほうが重要になる場合があります。

私たちは22人から得られた66件のホールドアウトされたインタビュー回答を用いて、この違いを検証しました。コンパクトな参加者プロファイルと過去の証拠の検索機能を備えたシンセティック回答者は、ブラインド評価による参加者適合性(participant-fit)の複合指標において、汎用的なGPT-5.4およびClaude Sonnet 5の回答を上回りました。主な優位性はGPTに対して25.49ポイント、Claudeに対して30.05ポイントでした。2つ目の審査モデルバージョンでも同様に肯定的な比較結果が再現されました。

この比較は、シンセティックオーディエンスの特定の用途を裏付けています。それは、特定の証拠に依存する質問に対して、関連する参加者の証拠を持ち込むという用途です。汎用モデルには参加者の履歴が一切与えられていませんでした。したがって、これは同一のコンテキスト下におけるモデル性能の順位付けではなく、グラウンディングされたワークフローと汎用プロンプティングとの比較です。

検証:事前の証拠と事後の回答

このベンチマークでは、レーザー歯科治療の開業医と難民の食料不安を対象とした2つの公開インタビューコーパスを使用しました。インタビュー前半の証拠からコンパクトなプロファイルと検索可能な記憶を構築しました。評価用として1人あたり後半の3つの回答をホールドアウトし、計22人から66件の対象回答を確保しました。

各対象質問に対して、プロファイル+検索、同一の基盤Geminiファミリーモデルによる汎用回答、汎用GPT-5.4、汎用Claude Sonnet 5の4つの匿名候補回答を用意しました。候補回答はスコアリング前にマスキングされ、審査モデルは条件ラベルなしで評価を行いました。

ルーブリックでは、実際の回答との一致度、視点と価値観、理由付け、具体性、トーンと回答の長さの適合性に加え、凡庸さや根拠のない個人情報の有無を評価しました。これらは参加者適合性の評価軸です。広告のコンバージョン率や汎用知能、あるいは正しくシミュレートされた人間の割合を測定するものではありません。

測定された優位性

参加者適合度の総合スコア

22 人、66 件の留保回答。主評価は自動判定です。汎用モデルには参加者履歴を与えておらず、同一文脈でのモデル順位ではありません。

  • プロフィール + 検索67.66
  • 汎用 GPT-5.442.17
  • 汎用 Claude Sonnet 537.61
  • 汎用 Gemini35.24
0スコア / 100100
プロファイル+検索との比較主力審査モデルの複合リフト参加者クラスタリングによる95%ブートストラップ区間第2審査モデルのリフト
同一モデルによる汎用Gemini回答+32.42 points+23.93 to +40.52+32.83 points
汎用GPT-5.4+25.49 points+15.99 to +34.56+26.13 points
汎用Claude Sonnet 5+30.05 points+21.86 to +38.12+30.68 points

主力審査モデルにおいて、グラウンディングされた条件は複合指標で67.66を記録しました。これに対し、汎用GPTは42.17、汎用Claudeは37.61、同一モデルによる汎用回答は35.24でした。両コーパスにおいて、2つの審査モデルバージョンのいずれでも、特定のGPTおよびClaude条件に対する正の平均優位性が示されました。

2つの審査モデルバージョンは、81.8%の項目で勝者の判定が一致しました。両方の審査モデルがGeminiファミリーのモデルであったため、これは同ファミリー内でのバージョン感度を検証したものであり、独立した人間の評価者間や無関係な審査モデルファミリー間の一致を検証したものではありません。

なぜグラウンディングが効果を発揮するのか

最も直接的な解釈は、関連する証拠へのアクセスです。汎用モデルは、欠落している個人のコンテキストを一般的なパターンで埋める必要があります。これに対して、グラウンディングされた回答者は記録された経験や選好を活用できます。

仕事上の意思決定に関する質問の場合、過去の証拠によってその人物の制約、これまでの経験、ある選択肢を別の選択肢よりも選んだ理由が特定されることがあります。その結果、回答は一般的な妥当なアドバイスを与えるのではなく、そうした具体的な詳細を反映できます。ベンチマークでは、グラウンディングされた条件は具体性と理由付けのスコアが高く、凡庸さが少ないと判定されました。

ここで同一モデルによる汎用比較が有用になります。基盤となるモデルファミリーを固定したままプロファイルと検索の条件を変更することで、このタスクにおいてグラウンディングワークフローを追加することの優位性が示されます。ただし、ワークフローのどの部分がどの程度のゲインをもたらしたかまでは特定されていません。プロファイル、検索、追加コンテキスト、および関連するプロンプティングが同時に変更されているためです。

この結果は、関連する記憶の有用性と整合しています。ただし、より多くのコンテキストを追加すれば常に役立つということや、保存されたすべての事実があらゆる回答に出現すべきであると証明するものではありません。

優位性が最も発揮されやすいケース

この実証結果は、調査の問いが個人の経歴、以前に表明された選好、具体的な経験、あるいは意思決定の背後にある理由に依存する場合に最も直接的に当てはまります。フォローアップインタビューや、同じ提案に対してオーディエンスメンバーの間で解釈が分かれる理由の探索などがこのパターンに該当します。

実務的な判断基準として有効なのは、その特定の人物の事前の回答を知ることで回答が実質的に変化するかどうかです。もし変化するのであれば、グラウンディングされた証拠には価値があると考えられます。一方、質問が一般的な事実知識しか要求しない場合、この実験では高性能な汎用モデルに対するシンセティックオーディエンスの優位性は実証されません。

インタビューベンチマーク内であっても、その優位性は普遍的ではありませんでした。探索的な内省的質問のスライスでは、GPTがグラウンディングされた条件を10.75ポイント上回りました。このスライスは3人からのわずか5項目しか含んでいないため、信頼性の高いタスク順位を確定するには規模が小さすぎます。それでも、平均値での勝利をあらゆる種類の質問における勝利と解釈すべきではないことを示しています。

サーベイには別個の説明が必要

Against Realityサーベイの概要では、確率ベースの回答収集が、強制選択形式の回答に比べて集計分布を一貫して改善することが判明しました。詳細なプロファイルは、一致する属性別の確率プロンプトを超えてそれらの分布を一貫して改善することはありませんでした。

これは、基底モデルとの公正な比較において重要です。確率ベースのオーディエンスと強制選択形式の汎用モデルを比較すると、グラウンディングの効果と回答フォーマットの効果が混在してしまいます。グラウンディングによる増分価値を測定することが目的である場合、両者には同一の回答規約が適用されるべきです。

Z世代の食に関するサーベイ検証は、より狭い範囲での定量例を示しています。その後のプロダクションランにおける誤差は6.01ポイントであり、凍結された汎用確率ベースラインの6.68ポイントと比較されました。この0.67ポイントの差は、汎用ベースラインが過去のデータであったため記述的なものにとどまります。これをもって、シンセティックオーディエンスがサーベイにおいて基底モデルを上回るという広範な主張を裏付けることはできません。

今回の比較が残す課題

本調査は小規模です。2つのコーパス、22人、66件の回答にとどまります。一部のインタビューは英語に翻訳されており、トーンや文体の意味合いに影響を与えています。モデルバージョンやサンプリング制御が異なっており、名指しされた汎用モデルには参加者の証拠が与えられていませんでした。等しいコンテキストでの比較を行うには、各モデルに同一の許可されたソース素材を提供し、回答規約を固定し、品質だけでなく結果として生じるコストも報告する必要があります。

また、スコアリングでは先行する確認実験からのインタビュー証拠セットを再利用しました。その先行比較と今回の4条件による評価は、2つの独立したサンプルではありません。今後の再現実験では、新たな参加者、異なる対象分野、独立した人間の評価、および各システムがどの情報を閲覧できるかについてのより厳格な管理を組み込むべきです。

本調査が裏付ける主張は、普遍的ではないものの有用です。すなわち、これらのホールドアウトされたインタビュー質問において、参加者に基づいてグラウンディングされたシンセティックオーディエンスは、テストされたモデルバージョンによる汎用回答よりも実際の人物により合致する回答を生成しました。関連する証拠の存在が、この優位性の中核でした。

オーディエンスのグラウンディングの背後にあるワークフローについては、Mindsパネルの構築方法を参照してください。検証チェックリストでは、シンセティックの結果を意思決定に必要な証拠と結び付ける方法を解説しています。

参照データ

De-identified, English Transcripts of 36 interviews

Transcription Data

CC BY 4.0