合成オーディエンスの精度主張を読む方法
九つの合成オーディエンスベンダーが精度の数値を発表しています。彼らは異なる指標、異なるベースライン、異なるサンプルを使用しているため、数値を互いに比較することはできません。検証可能な主張と検証不可能な主張を分ける八つの質問があります。
合成研究ベンダーは、85%から98%の間の精度数値を発表しています。急いで読むと、この分野は確立されているように見え、違いは小さく見えます。
しかし、比較可能ではありません。パーセンテージは異なるタスクに対して異なるベースラインで異なる量を測定しており、いくつかは全く精度を測定していません。この記事では、2026年9月に九つのベンダーの発表資料を読み取った結果と、検証可能な主張と検証不可能な主張を分ける八つの質問を示します。
私たちにはここに利害関係があります。Mindsは合成オーディエンスを販売しています。したがって、以下の基準は私たちにも同じ条件で適用され、私たちが最も悪い結果を出す場所は、他の誰のものと同様に明確に示されています。
八つの質問
発表された精度主張は、次の質問に答えるときに検証可能です:
- どの外部基準に対して? 名前のある独立したデータセットまたは発表された研究、内部サンプルではなく。
- どの限界に対して? 人間は自分の回答を完璧に再現しません。彼らの自己一貫性が現実的な最大値です。
- どの下限に対して? モデルがない状態で同じ指標が得られるスコア。
- その指標は何を意味しますか? 「精度」は自己定義ではありません。
- どのベースラインと比較して? 同じモデルへの単純なプロンプトが重要な比較です。なぜなら、それが無料の代替だからです。
- 誰がレビューしましたか? ピアレビューまたはプレプリントは修正を招きます。
- どこで失敗しますか? 公開された失敗モードがない方法は、十分にテストされていないことを示しています。
- 誰でもチェックできますか? 方法、サンプル、データが検査可能であること。
フィールドが発表するもの
ベンダー自身の公開ページと論文からまとめたもの、2026年9月。
| ベンダー | ヘッドライン数値 | 測定内容 |
|---|---|---|
| Simile | 人間の自己再テスト信頼性の85% | ソース個体の回答の再現、対人間のノイズフロア |
| Artificial Societies | 86%の分布精度 | 分布の一致、91%の人間の限界に対して |
| Articos | 専門家が特定したテーマの86% | 発表された専門家の報告に対するテーマの回収 |
| Evelance | 89.78%のテーマ重複 | テーマの一致、7つのペルソナ対23人の実際のユーザー |
| Synthetic Users | 85–92%「合成オーガニックパリティ」 | 合成インタビューと実際のインタビューの類似性 |
| Aaru | 0.90の中央値相関 | 一つのクライアント研究における相関 |
| Evidenza | 88%の精度、0.81の相関 | 指標は公開されていない |
| Fairgen | 98%のサニティパス率 | 内部品質ゲート、精度ではない |
| Minds | スピアマン0.85、+4%のスケールバイアス | 54の広告に対する人間パネルとの順位相関 |
二つの観察が続きますが、どちらもどの製品が優れているかについてではありません。
最も高い数値は精度の数値ではありません。 Fairgenの98%は、彼ら自身の六次元品質ゲートを通過した生成されたプロファイルの割合です。それは出力が人間のデータと一致するかどうかについて何も言っておらず、Fairgenもそれを主張していません。この表をパーセンテージで並べ替える人は、彼らが参加していない測定で最初にランク付けされることになります。
比較可能なのは二つの数値だけです。 Simileの85%とArtificial Societiesの86%は、どちらも人間自身が達成するものの割合として表現されています。彼らは比較可能です。他の列の何も互いに比較できません。
失敗を発表するのは誰か
ここがフィールドが最も鋭く分かれるところです。
Fairgenは、彼らの方法が不適切な研究を明示しています:ブランドトラッキング、セグメンテーション、コンジョイント。彼らのガイダンスは「フィールドに出る前に圧力テストを行うこと、代わりにではなく」です。Synthetic Usersは、キャリブレーションなしの合成回答者は「個々には信じられるが、集団としては間違っている」と述べています。ArticosとEvelanceは、彼らの出力が方向性を持ち、人間の研究と並んで存在すべきであると言っています。
Aaru、Evidenza、Artificial Societiesは、私たちが見つけられる失敗条件を発表していません。
私たちの立場、ギャップを含む
私たち自身の研究は四条件のアブレーションを使用し、実際の回答を保持し、ターゲットが開かれる前に候補選択を封印し、結果の横にチャンスの下限を報告します。あるGSSアイテムセットでは、モデルがない状態でフラットな分布がすでに83.71%のスコアを記録しています。私たちの92.47%は残りの距離の54%を縮めます。下限はパーセンテージの横に置かれるべきもので、通常は欠けています。
私たちは機能しなかった結果を発表します。登録されたプロファイルのリフトが0.17ポイントで、95%の区間が-1.00から+1.31の間で、ゼロを越え、プロモーション基準を満たしませんでした。盲目的な比較での短い日常的なプロンプトでは、私たちのオーディエンスは一般的なプロンプトに対して13.8%、人口統計的なプロンプトに対して30.5%、34.0%で勝ちました。それは損失であり、公開されています。
私たちにはピアレビューがありません。 Simileのファインチューニング結果は、290万の応答のオープンデータセットでEMNLP 2025に登場しました。Artificial Societiesは、英国心理学ジャーナル (British Journal of Psychology)にグループ行動の結果を持っています。私たちはどちらも持っていません。私たちの検証作業は自サイトに公開されており、外部レビューを経ていないため、読者はそれを異なる重みで評価するのが正しいです。
私たちのSINUS-Institutとのパートナーシップは、時に検証として読まれますが、そうではありません。それは出所です:私たちのペルソナが基づいているミレイユモデルは、数十年にわたる彼らの研究から来ており、これは精度についてではなく、入力についての声明です。彼らのマネージングディレクターは明確に述べています:ミレイユ・マインズは「社会研究や私たちの研究所の専門知識を置き換えるものではありません」。
どのベンダーでも10分でチェックする方法
指標の定義、サンプルサイズ、ベースライン、失敗条件を尋ねてください。同じ測定がモデルなしでどのようなスコアを得るかを尋ねてください。ベンダーがそれらを提示できない場合、そのパーセンテージはマーケティングであり、誰が発表したかに関わらず、どれほど好意的に見えてもそうです。
そのテストは私たちにとっても快適ではありません。それは単に、買い手に何かを伝える唯一の方法です。
出典
上記のすべての数値は、各ベンダー自身の公開資料から取得したものです(2026年9月22日取得)。主張は変わります。依拠する前に出典をご確認ください。当社が誤読していた場合はお知らせください。訂正します。
よくある質問
合成オーディエンスの精度はどのくらいですか?
単一の数値はありません。発表された数値は85%から98%の範囲ですが、異なるものを測定しています:テーマの重複、分布の一致、応答の一貫性、品質ゲートの合格率、順位相関は互換性がありません。精度の数値は、その指標、ベースライン、測定されたタスクと共に意味を持ちます。
なぜ二つのベンダーの精度パーセンテージを比較できないのですか?
分母が異なるからです。一つのベンダーは専門家の報告から回収したテーマの割合を報告し、別のベンダーは一致する応答分布の割合を報告し、また別のベンダーは内部品質ゲートを通過した生成されたプロファイルの割合を報告します。それらの数値を互いに比較すると、意味のない順序が生まれます。
人間の限界とは何ですか、そしてそれはなぜ重要ですか?
人間は自分の調査回答を完璧に再現することはありません。二週間後に再度尋ねられると、自分自身と異なります。その自己一貫性率は、どんなシミュレーションにとっても現実的な限界ですので、その結果をその割合として報告することは、生のパーセンテージを報告するよりも情報価値があります。
チャンスの下限とは何ですか?
モデルやデータがない状態で達成されるスコアです。私たちのGSSアイテムセットの一つでは、フラットな分布がすでに83.71%のスコアを記録しています。したがって、報告された92.47%は、その下限と完璧なスコアの間の54%の距離を縮めており、これは「92%の精度」とは非常に異なる主張です。


