---
title: "合成オーディエンスの精度主張を読む方法"
description: "合成研究ベンダーは、85%から98%の間の精度パーセンテージを発表しています。ほとんどのベンダーは同じことを測定していません。どの主張が検証可能かを見分ける方法を紹介します。"
canonical_url: "https://getminds.ai/blog/ja/how-to-read-synthetic-audience-accuracy-claims"
last_updated: "2026-10-03T07:32:22.556Z"
---

# 合成オーディエンスの精度主張を読む方法

合成研究ベンダーは、85%から98%の間の精度数値を発表しています。急いで読むと、この分野は確立されているように見え、違いは小さく見えます。

しかし、比較可能ではありません。パーセンテージは異なるタスクに対して異なるベースラインで異なる量を測定しており、いくつかは全く精度を測定していません。この記事では、2026年9月に九つのベンダーの発表資料を読み取った結果と、検証可能な主張と検証不可能な主張を分ける八つの質問を示します。

私たちにはここに利害関係があります。Mindsは合成オーディエンスを販売しています。したがって、以下の基準は私たちにも同じ条件で適用され、私たちが最も悪い結果を出す場所は、他の誰のものと同様に明確に示されています。

## 八つの質問

発表された精度主張は、次の質問に答えるときに検証可能です：

1. **どの外部基準に対して？** 名前のある独立したデータセットまたは発表された研究、内部サンプルではなく。
2. **どの限界に対して？** 人間は自分の回答を完璧に再現しません。彼らの自己一貫性が現実的な最大値です。
3. **どの下限に対して？** モデルがない状態で同じ指標が得られるスコア。
4. **その指標は何を意味しますか？** 「精度」は自己定義ではありません。
5. **どのベースラインと比較して？** 同じモデルへの単純なプロンプトが重要な比較です。なぜなら、それが無料の代替だからです。
6. **誰がレビューしましたか？** ピアレビューまたはプレプリントは修正を招きます。
7. **どこで失敗しますか？** 公開された失敗モードがない方法は、十分にテストされていないことを示しています。
8. **誰でもチェックできますか？** 方法、サンプル、データが検査可能であること。

## フィールドが発表するもの

ベンダー自身の公開ページと論文からまとめたもの、2026年9月。

<table>
<thead>
  <tr>
    <th>
      ベンダー
    </th>
    
    <th>
      ヘッドライン数値
    </th>
    
    <th>
      測定内容
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      Simile
    </td>
    
    <td>
      人間の自己再テスト信頼性の85%
    </td>
    
    <td>
      ソース個体の回答の再現、対人間のノイズフロア
    </td>
  </tr>
  
  <tr>
    <td>
      Artificial Societies
    </td>
    
    <td>
      86%の分布精度
    </td>
    
    <td>
      分布の一致、91%の人間の限界に対して
    </td>
  </tr>
  
  <tr>
    <td>
      Articos
    </td>
    
    <td>
      専門家が特定したテーマの86%
    </td>
    
    <td>
      発表された専門家の報告に対するテーマの回収
    </td>
  </tr>
  
  <tr>
    <td>
      Evelance
    </td>
    
    <td>
      89.78%のテーマ重複
    </td>
    
    <td>
      テーマの一致、7つのペルソナ対23人の実際のユーザー
    </td>
  </tr>
  
  <tr>
    <td>
      Synthetic Users
    </td>
    
    <td>
      85–92%「合成オーガニックパリティ」
    </td>
    
    <td>
      合成インタビューと実際のインタビューの類似性
    </td>
  </tr>
  
  <tr>
    <td>
      Aaru
    </td>
    
    <td>
      0.90の中央値相関
    </td>
    
    <td>
      一つのクライアント研究における相関
    </td>
  </tr>
  
  <tr>
    <td>
      Evidenza
    </td>
    
    <td>
      88%の精度、0.81の相関
    </td>
    
    <td>
      指標は公開されていない
    </td>
  </tr>
  
  <tr>
    <td>
      Fairgen
    </td>
    
    <td>
      98%のサニティパス率
    </td>
    
    <td>
      内部品質ゲート、精度ではない
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      スピアマン0.85、+4%のスケールバイアス
    </td>
    
    <td>
      54の広告に対する人間パネルとの順位相関
    </td>
  </tr>
</tbody>
</table>

二つの観察が続きますが、どちらもどの製品が優れているかについてではありません。

**最も高い数値は精度の数値ではありません。** Fairgenの98%は、彼ら自身の六次元品質ゲートを通過した生成されたプロファイルの割合です。それは出力が人間のデータと一致するかどうかについて何も言っておらず、Fairgenもそれを主張していません。この表をパーセンテージで並べ替える人は、彼らが参加していない測定で最初にランク付けされることになります。

**比較可能なのは二つの数値だけです。** Simileの85%とArtificial Societiesの86%は、どちらも人間自身が達成するものの割合として表現されています。彼らは比較可能です。他の列の何も互いに比較できません。

## 失敗を発表するのは誰か

ここがフィールドが最も鋭く分かれるところです。

Fairgenは、彼らの方法が不適切な研究を明示しています：ブランドトラッキング、セグメンテーション、コンジョイント。彼らのガイダンスは「フィールドに出る前に圧力テストを行うこと、代わりにではなく」です。Synthetic Usersは、キャリブレーションなしの合成回答者は「個々には信じられるが、集団としては間違っている」と述べています。ArticosとEvelanceは、彼らの出力が方向性を持ち、人間の研究と並んで存在すべきであると言っています。

Aaru、Evidenza、Artificial Societiesは、私たちが見つけられる失敗条件を発表していません。

## 私たちの立場、ギャップを含む

私たち自身の研究は四条件のアブレーションを使用し、実際の回答を保持し、ターゲットが開かれる前に候補選択を封印し、結果の横にチャンスの下限を報告します。あるGSSアイテムセットでは、モデルがない状態でフラットな分布がすでに83.71%のスコアを記録しています。私たちの92.47%は残りの距離の54%を縮めます。下限はパーセンテージの横に置かれるべきもので、通常は欠けています。

私たちは機能しなかった結果を発表します。登録されたプロファイルのリフトが0.17ポイントで、95%の区間が-1.00から+1.31の間で、ゼロを越え、プロモーション基準を満たしませんでした。盲目的な比較での短い日常的なプロンプトでは、私たちのオーディエンスは一般的なプロンプトに対して13.8%、人口統計的なプロンプトに対して30.5%、34.0%で勝ちました。それは損失であり、公開されています。

**私たちにはピアレビューがありません。** Simileのファインチューニング結果は、290万の応答のオープンデータセットでEMNLP 2025に登場しました。Artificial Societiesは、英国心理学ジャーナル (British Journal of Psychology)にグループ行動の結果を持っています。私たちはどちらも持っていません。私たちの検証作業は自サイトに公開されており、外部レビューを経ていないため、読者はそれを異なる重みで評価するのが正しいです。

私たちのSINUS-Institutとのパートナーシップは、時に検証として読まれますが、そうではありません。それは出所です：私たちのペルソナが基づいているミレイユモデルは、数十年にわたる彼らの研究から来ており、これは精度についてではなく、入力についての声明です。彼らのマネージングディレクターは明確に述べています：ミレイユ・マインズは「社会研究や私たちの研究所の専門知識を置き換えるものではありません」。

## どのベンダーでも10分でチェックする方法

指標の定義、サンプルサイズ、ベースライン、失敗条件を尋ねてください。同じ測定がモデルなしでどのようなスコアを得るかを尋ねてください。ベンダーがそれらを提示できない場合、そのパーセンテージはマーケティングであり、誰が発表したかに関わらず、どれほど好意的に見えてもそうです。

そのテストは私たちにとっても快適ではありません。それは単に、買い手に何かを伝える唯一の方法です。

## 出典

上記のすべての数値は、各ベンダー自身の公開資料から取得したものです（2026年9月22日取得）。主張は変わります。依拠する前に出典をご確認ください。当社が誤読していた場合はお知らせください。訂正します。

- [Simile](https://www.simile.com/)
- [Simile, EMNLP 2025 (Kolluri, Wu, Park, Bernstein), SocSci210](https://arxiv.org/abs/2607.26348)
- [Artificial Societies](https://societies.ai/)
- [Artificial Societies, the science behind it](https://societies.io/ai-simulation-research)
- [Articos](https://articos.com/)
- [Evelance](https://evelance.io/)
- [Synthetic Users, science](https://www.syntheticusers.com/science)
- [Aaru](https://www.aaru.com/)
- [Evidenza](https://www.evidenza.ai/)
- [Evidenza, research](https://www.evidenza.ai/research)
- [Fairgen](https://www.fairgen.ai/)
- [Minds validation studies](https://getminds.ai/research)
- [SINUS-Institut and Minds, original release](https://getminds.ai/press/minds-partners-with-sinus)
