---
title: "Gerçek Mülakat Yanıtlarında Minds, GPT-5.4 ve Claude Sonnet 5'e Karşı"
description: "Kanıta dayalı Minds'ı, ayrılmış gerçek insan mülakat yanıtlarında jenerik GPT-5.4 ve Claude Sonnet 5 ile karşılaştıran körleme nitel bir benchmark."
canonical_url: "https://getminds.ai/research/tr/minds-vs-foundation-models-qualitative-2026"
last_updated: "2026-08-13T13:07:42.308Z"
---

# Gerçek Mülakat Yanıtlarında Minds, GPT-5.4 ve Claude Sonnet 5'e Karşı

Sentetik bir katılımcıyı kullanışlı kılan şey, makul bir ifade üretebilmesi değildir. Yeni bir soru sorulduğunda gerçek bir kişinin bakış açısını sürdürüp sürdüremediğidir.

Minds Research Lab bunu doğrudan test etti. İki bağımsız açık nitel veri setindeki 22 gerçek görüşülen kişiden elde edilen 66 ayrılmış sonraki yanıtı kullandık. Kanıta dayalı Minds; jenerik GPT-5.4, Claude Sonnet 5 ve aynı modelin jenerik yanıtı ile karşılaştırıldı.

Minds, GPT-5.4'ü **25.49 bileşik puan**, Claude Sonnet 5'i ise **30.05 puan** geride bıraktı. İkinci bir kör değerlendirici her iki sonucu da doğruladı.

<study-stats>



</study-stats>

## Benchmark

Çalışmada bağımsız olarak yayınlanmış ve açık lisanslı iki mülakat korpusu kullanıldı:

- Utah Üniversitesi araştırmacıları tarafından yayınlanan [Mülteci gıda güvensizliği üzerine kimliksizleştirilmiş mülakatlar](https://doi.org/10.6084/m9.figshare.29318549.v1).
- Khon Kaen Üniversitesi araştırmacıları tarafından yayınlanan [Uluslararası lazer diş hekimliği mülakat dökümleri](https://doi.org/10.6084/m9.figshare.28456946.v1).

Her bir katılımcı için önceki içerikler sentetik yanıtlayıcıyı beslemek üzere kullanılırken, sonraki yanıtlar değerlendirme için ayrıldı. Modeller aynı mülakat sorusunu ve aynı yanıt biçimi talimatını aldı. Jenerik temel modeller herhangi bir katılımcı hafızası veya profili almadı.

Tüm aday yanıtlar, ayrılmış yanıtlar puanlama için kullanılmadan önce üretildi. Aday etiketleri, değerlendiricinin hangi modelin hangi yanıtı ürettiğini görememesi için rastgele sıralandı.

## Sonuçlar

<table>
<thead>
  <tr>
    <th>
      Aday
    </th>
    
    <th align="right">
      Bileşik puan
    </th>
    
    <th align="right">
      Kazanma oranı
    </th>
    
    <th align="right">
      Minds ile fark
    </th>
  </tr>
</thead>

<tbody>
  <tr>
    <td>
      <strong>
        Minds
      </strong>
    </td>
    
    <td align="right">
      <strong>
        67.66
      </strong>
    </td>
    
    <td align="right">
      <strong>
        72.7%
      </strong>
    </td>
    
    <td align="right">
      -
    </td>
  </tr>
  
  <tr>
    <td>
      GPT-5.4
    </td>
    
    <td align="right">
      42.17
    </td>
    
    <td align="right">
      16.7%
    </td>
    
    <td align="right">
      <strong>
        Minds +25.49
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Claude Sonnet 5
    </td>
    
    <td align="right">
      37.61
    </td>
    
    <td align="right">
      0.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +30.05
      </strong>
    </td>
  </tr>
  
  <tr>
    <td>
      Jenerik aynı model yanıtı
    </td>
    
    <td align="right">
      35.24
    </td>
    
    <td align="right">
      3.0%
    </td>
    
    <td align="right">
      <strong>
        Minds +32.42
      </strong>
    </td>
  </tr>
</tbody>
</table>

Katılımcı düzeyinde kümelenmiş %95 güven aralığı GPT-5.4'e karşı **+15.99 ila +34.56** ve Claude Sonnet 5'e karşı **+21.86 ila +38.12** oldu. Her iki mülakat korpusu da bağımsız olarak pozitif sonuç verdi.

İkinci bir değerlendirici sürümü, **+26.13** ve **+30.68** puanlık artışları tekrarladı. İki değerlendirici, bireysel yanıtların %81.8'inde kazanan aday üzerinde uzlaştı.

## Minds nerede kazandı

Rubrik, yüzeysel akıcılığın ötesini ölçtü. Her adayı, kişinin gerçek sonraki yanıtıyla şu kriterler üzerinden karşılaştırdı:

- Anlamsal uyum
- Bakış açısı ve değerler
- Temalar ve gerekçeler
- Somutluk ve detay düzeyi
- Ses tonu ve üslup
- Uzunluk uyumu
- Jeneriklik
- Desteklenmeyen kişisel bilgiler

Minds'ın en büyük avantajları anlamsal uyum, bakış açısı, gerekçeler, somutluk ve tanınabilir ses tonunda ortaya çıktı. Başka bir deyişle, Minds yalnızca kulağa daha cilalı gelmekle kalmadı; o kişinin neyi önemsediğini, bunu nasıl açıkladığını ve doğal olarak hangi detayları kullandığını koruma olasılığı daha yüksekti.

Bu avantaj, yanıt uzunluğuna bağlı bir yapay durum değildi. Aday yanıtlar tüm koşullarda ortalama 52 ila 60 kelime arasındaydı.

## Bunun ChatGPT'den bir persona gibi davranmasını istemekten farkı nedir

Jenerik bir model son derece yeteneklidir, ancak soru tek başına kişinin geçmişini içermez. Model, soyutlanmış biri için makul olan bir yanıt üretmek zorundadır.

Bir Mind ise kalıcı bir araştırma katılımcısını sürdürmek üzere tasarlanmıştır. Onaylanmış bilgileri, önceki araştırma bağlamını ve farklılaşmış bir bakış açısını yeni sorulara taşıyabilir. Bu durum, görev dünyayı bilmekten ziyade kişiyi tanımaya dayandığında, daha küçük veya daha düşük maliyetli bir modelin çok daha büyük jenerik bir modeli geride bırakmasını sağlar.

Bu, ölçülebilir formdaki temel Minds tezidir: **kişilik derinliği ve ilgili hafıza, ham temel model ölçeğinden daha önemli olabilir.**

## Ek nitel doğrulama

Aynı kapsamlı araştırma programı şunları da test etti:

- Değerler, tartışmalı konular ve yönlendirmesiz komutlar genelinde dokunulmamış 299 katılımcı ve 869 uygun insan yanıtı kullanılarak yapılan [PRISM](https://arxiv.org/abs/2404.16019).
- Uzun soluklu profesyonel mülakatlarda sürekliliği test etmek için sonraki yanıtların kullanıldığı [NASA Sözlü Tarih koleksiyonu](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/).
- Mülteci mülakatı korpusundan ayrılan 21 kişilik ayrı bir dil kohortu.

PRISM genelinde, eksiksiz Minds profilleri jenerik ve demografik yönlendirmelerin yaklaşık **10 ila 12 puan üzerinde** puan aldı. Ayrı dil kohortu ayrımında ise Mind koşulu genel jenerik yanıtlara göre **20.77 puanlık** bir iyileşme sağladı.

## Müşteri araştırmaları için ne anlama geliyor

Jenerik temel modeller, makul reaksiyonlar için beyin fırtınası yapmada kullanışlıdır. Minds ise farklı bir standart için tasarlanmıştır: bir araştırma boyunca farklılaşmış katılımcıları korumak.

Bu da Minds'ı özellikle keşifsel mülakatlar, konsept reaksiyonları, mesaj testleri, itiraz keşfi, satın alma komitesi araştırmaları, persona tabanlı takip görüşmeleri ve mevcut bir araştırma arşivini etkileşimli bir hedef kitleye dönüştürmek için son derece elverişli kılar.

İsmi geçen modellerin sonuçları, test edilen mülakat kaynaklarını ve model sürümlerini kapsar. Minds Research Lab, temel karşılaştırmayı gerçek insan yanıtlarına sadık tutarak benchmark'ı farklı alanlara, dillere ve soru türlerine genişletmeye devam etmektedir.

Nicel kanıtlar için [Real Survey Benchmarks](/research/survey-approximation-benchmarks-2026) sayfasını okuyun. Kapsamlı program için [Minds Research Benchmark 2026](/research/real-world-validation-benchmarks-2026) sayfasını okuyun.

## Açık benchmark kaynakları

- [Utah mülteci mülakat dökümleri](https://doi.org/10.6084/m9.figshare.29318549.v1)
- [Uluslararası lazer diş hekimliği dökümleri](https://doi.org/10.6084/m9.figshare.28456946.v1)
- [PRISM Alignment Dataset](https://arxiv.org/abs/2404.16019)
- [NASA Sözlü Tarihleri](https://www.nasa.gov/history/history-publications-and-resources/oral-histories/nasa-list/)

## Önerilen atıf

Minds Research Lab. “Minds vs GPT-5.4 and Claude Sonnet 5 on Real Interview Answers.” 11 Ağustos 2026. [https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026](https://getminds.ai/research/minds-vs-foundation-models-qualitative-2026)
