---
title: "人格条件付けは合成回答者をより個性的にする"
description: "英国299プロフィールと869件のホールドアウト対象を用いたブラインド評価で、人格条件付きMindsは汎用・属性プロンプトより多く選ばれました。"
canonical_url: "https://getminds.ai/research/ja/personality-conditioned-synthetic-respondents-benchmark-2026"
last_updated: "2026-08-13T13:08:04.009Z"
---

# 人格条件付けは合成回答者をより個性的にする

人格条件付きMindsは、長さを合わせたブラインド比較の**32.57%で選ばれ、属性プロンプトの25.66%**、汎用プロンプトの**20.48%**を上回りました。**21.29%**は同率です。

最も明確な利点は、単に人間らしく聞こえることではなく、**特定の人**らしく聞こえることでした。価値観を表現し、関連する具体性を加え、人と人の違いをよりはっきり示します。同じ問いを異なるオーディエンスがどう捉えるかを探る合成リサーチに必要な品質です。

<study-stats>



</study-stats>

## なぜ人格条件付けが重要なのか

汎用モデルはもっともらしい回答を作れます。しかし市場調査では、優先順位、好み、世界観の意味ある違いを反映した回答が必要です。

本ベンチマークは、属性情報と、本人が記述し利用が許可された人格情報に基づく完全なMindが、文脈なし／属性のみの同一モデルよりもホールドアウトされた定性表現を再現できるかを検証しました。

対象は参加者本人が書いた短い会話の書き出しです。調査分布や客観的な「真の意見」ではなく、プロフィールへの定性的適合を測っています。

## 3条件のブラインド評価

[PRISM Alignment Dataset](https://github.com/HannahKirk/prism-alignment)の**英国参加者299プロフィール**（revision `a9ec82149036374768f70e132a2369a750e06bbe`）を使用し、**869件の観測ホールドアウト対象**を評価しました。

<table>
<thead>
  <tr>
    <th>
      条件
    </th>
    
    <th>
      参加者文脈
    </th>
    
    <th>
      実行
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      汎用
    </td>
    
    <td>
      文脈なし
    </td>
    
    <td>
      Gemini 3.6 Flashを直接実行
    </td>
  </tr>
  
  <tr>
    <td>
      属性
    </td>
    
    <td>
      年齢、性別、国、雇用、教育
    </td>
    
    <td>
      Gemini 3.6 Flashを直接実行
    </td>
  </tr>
  
  <tr>
    <td>
      Minds
    </td>
    
    <td>
      属性＋許可された価値観、好み、望ましいアシスタント行動、学習プロンプト
    </td>
    
    <td>
      本番Panels API（persona、RAG、web grounding有効）；Gemini 3.6 Flash
    </td>
  </tr>
</tbody>
</table>

対象文とその派生情報は生成コンテキストから除外しました。1名のブラインドGemini 3.6 Flash判定者が、プロフィール情報、人間のホールドアウト参照文、匿名化された3候補を確認しました。

長さだけで結果が決まらないよう、判定前に各候補を人間参照文と同じ語数に切り揃えました。869件すべてで3条件の完全な判定を得ています。

## Mindsが最も多く選ばれた

<table>
<thead>
  <tr>
    <th>
      結果
    </th>
    
    <th align="right">
      汎用
    </th>
    
    <th align="right">
      属性
    </th>
    
    <th align="right">
      Minds
    </th>
    
    <th align="right">
      同率
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      勝者数
    </td>
    
    <td align="right">
      178
    </td>
    
    <td align="right">
      223
    </td>
    
    <td align="right">
      <strong>
        283
      </strong>
    </td>
    
    <td align="right">
      185
    </td>
  </tr>
  
  <tr>
    <td>
      869件に占める割合
    </td>
    
    <td align="right">
      20.48%
    </td>
    
    <td align="right">
      25.66%
    </td>
    
    <td align="right">
      <strong>
        32.57%
      </strong>
    </td>
    
    <td align="right">
      21.29%
    </td>
  </tr>
  
  <tr>
    <td>
      判定忠実度総合、0–100
    </td>
    
    <td align="right">
      27.23
    </td>
    
    <td align="right">
      27.68
    </td>
    
    <td align="right">
      <strong>
        32.38
      </strong>
    </td>
    
    <td align="right">
      —
    </td>
  </tr>
</tbody>
</table>

Mindsの勝率は汎用より**+12.04ポイント**（95% CI +7.13〜+17.00、FDR調整`p < .001`）、属性より**+6.69ポイント**（95% CI +1.56〜+11.93、`p = .020`）高い結果でした。

## 最も強いシグナル：価値観と具体性

<table>
<thead>
  <tr>
    <th>
      質問文脈
    </th>
    
    <th align="right">
      汎用
    </th>
    
    <th align="right">
      属性
    </th>
    
    <th align="right">
      Minds
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      価値観誘導
    </td>
    
    <td align="right">
      19.30%
    </td>
    
    <td align="right">
      11.58%
    </td>
    
    <td align="right">
      <strong>
        42.81%
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      論争テーマ誘導
    </td>
    
    <td align="right">
      18.88%
    </td>
    
    <td align="right">
      34.97%
    </td>
    
    <td align="right">
      <strong>
        38.81%
      </strong>
    </td>
  </tr>
</tbody>
</table>

Mindsは価値観／人格で**36.88**、具体性で**33.46**。汎用は30.85と21.70、属性は31.85と23.36でした。汎用性スコアもMindsは**63.63**（低いほど良い）で、汎用**73.53**、属性**72.58**を下回りました。

個人間の回答差も大きくなりました。平均TF–IDF類似度はMinds 0.0308、属性0.0516、汎用0.1108。人間参照文は0.0128とさらに多様ですが、人格条件付けはモデルをその方向へ大きく近づけました。

## 年齢コホートから得られたシグナル

最も一貫した改善は高年齢層で見られました。55–64歳は補正後の勝率と総合スコアで両ベースラインを上回り、65歳以上は汎用を明確に上回りました。45–54歳も総合スコアで属性条件を上回りました。

サブグループ結果は探索的ですが、蓄積された好みや価値観が人格条件付けにより豊かなシグナルを与える可能性を示します。

## 豊かな回答を公平に比較

Mindsの完全回答は平均**51.62語**、汎用は**7.86語**、属性は**7.51語**でした。長さ合わせにより、追加の詳細が単に文章量だけで有利にならないようにしています。

実務上、Mindsは定性探索のための豊かな素材を生成できます。次の製品ステップは、タスクに応じて回答の深さを適応させることです。全条件で比較可能なend-to-endトークン使用量は記録されていないため、金額ベースのコスト比は示せません。

## エビデンスの読み方

- **項目ごとに判定者1名（n=1）。** Gemini 3.6 Flashによる1回のブラインド判定で、人間較正はありません。
- **同一モデル系統。** 回答条件と判定者はいずれもGemini 3.6 Flashです。
- **定性的な対象。** ホールドアウト人間文への適合を測り、人口比率や購買行動は測っていません。
- **end-to-endシステム。** 人格、検索、grounding、出力整形をまとめて評価しました。

semantic de-duplicationは**独立したablationで分離されていません**。その効果はこの結果だけでは判断できず、削除の根拠にもなりません。

この869件は今後の製品改善に使用します。将来のリリース主張には、新しい未使用ホールドアウトと、可能であれば複数判定または人間較正が必要です。

## 次に検証すること

次のablationでは、1. 現行の本番挙動、2. 人間相当の長さ、3. 人間相当の長さ＋価値が高い場面で人格の深さを適用する適応型question routingを比較します。

## 合成リサーチにとっての意味

実務的な結論は明確です。**このブラインド評価では、人格条件付けが汎用または属性プロンプトだけの場合よりも個性的な定性回答者を生み出しました。**

Mindsは、オーディエンス仮説の生成とストレステスト、異なる価値観フレームの探索、異なる人々が使い得る言葉の発見に特に有用です。人間のエビデンスを補完し、汎用モデル回答よりも差別化された出発点を提供します。

## 推奨引用

Minds Research Lab.「人格条件付けは合成回答者をより個性的にする」2026年8月8日。[https://getminds.ai/research/ja/personality-conditioned-synthetic-respondents-benchmark-2026](https://getminds.ai/research/ja/personality-conditioned-synthetic-respondents-benchmark-2026)
