·Methodology·Minds Team

Sentetik Hedef Kitle Doğruluk İddalarını Nasıl Okursunuz

Dokuz sentetik hedef kitle sağlayıcısı doğruluk rakamları yayınlıyor. Farklı metrikler, farklı temel değerler ve farklı örnekler kullandıkları için rakamlar birbirleriyle karşılaştırılamaz. Sekiz soru, kontrol edilebilir bir iddiayı, çürütülemez bir iddiadan ayırır.

Sentetik araştırma sağlayıcıları, %85 ile %98 arasında doğruluk rakamları yayınlıyor. Hızlıca okunduğunda, alan yerleşmiş gibi görünüyor ve farklılıklar küçük görünüyor.

Bunlar karşılaştırılamaz. Yüzdeler, farklı görevlerde farklı temel değerler karşısında farklı miktarları ölçüyor ve bazıları doğruluğu hiç ölçmüyor. Bu makale, Eylül 2026'da dokuz sağlayıcının yayınladığı materyalleri okurken bulduklarımızı ve kontrol edebileceğiniz bir iddiayı, edemeyeceğiniz bir iddiadan ayıran sekiz soruyu ortaya koyuyor.

Burada bir çıkarımız var. Minds, sentetik hedef kitleler satıyor. Bu nedenle aşağıdaki standart, bizim için aynı şartlarla uygulanıyor ve en kötü durumda olduğumuz yer, herkesin olduğu kadar açık bir şekilde belirtiliyor.

Sekiz soru

Yayınlanan bir doğruluk iddiası, bu soruları yanıtladığında kontrol edilebilir:

  1. Hangi dış standart karşısında? İsimlendirilmiş, bağımsız bir veri seti veya yayınlanmış bir çalışma, iç örnek değil.
  2. Hangi tavana karşı? İnsanlar kendi yanıtlarını mükemmel bir şekilde yeniden üretmezler. Kendilik tutarlılığı gerçekçi maksimumdur.
  3. Hangi tabana karşı? Aynı metrik, arkasında hiçbir model olmadan ne puan alıyor.
  4. Metrik ne anlama geliyor? "Doğruluk" kendiliğinden tanımlayıcı değildir.
  5. Hangi temel değerle karşılaştırılıyor? Aynı modele naif bir istem, önemli olan karşılaştırmadır, çünkü bu ücretsiz alternatiftir.
  6. Kim tarafından gözden geçirildi? Hakemli inceleme veya bir ön baskı düzeltmeyi davet eder.
  7. Nerede başarısız oluyor? Yayınlanmış bir başarısızlık modu olmayan bir yöntem, yeterince zorlanmadığı için bir tane bulamamıştır.
  8. Herkes bunu kontrol edebilir mi? Yöntem, örnek ve veri inceleme için mevcut.

Alanın yayınladıkları

Sağlayıcıların kendi kamu sayfalarından ve belgelerinden derlenmiştir, Eylül 2026.

SağlayıcıBaşlık rakamıNe ölçüyor
Simile%85 insan kendi yeniden test güvenilirliğiKaynak bireylerin yanıtlarının yeniden üretimi, insan gürültü tabanına karşı
Artificial Societies%86 dağılım doğruluğuDağılım uyumu, belirtilen %91 insan tavanına karşı
Articos%86 uzman tarafından tanımlanan temaTema kurtarma, yayınlanmış uzman raporlarına karşı
Evelance%89.78 tematik örtüşmeTema eşleşmesi, 7 persona vs 23 gerçek kullanıcı
Synthetic Users%85–92 "Sentetik Organik Eşitlik"Sentetik ile gerçek mülakatların benzerliği
Aaru0.90 medyan korelasyonBir müşteri çalışmasındaki korelasyon
Evidenza%88 doğruluk, 0.81 korelasyonMetrik kamuya tanımlanmamış
Fairgen%98 akıl geçiş oranıİç kalite kapısı, doğruluk değil
MindsSpearman 0.85, +4% ölçek yanlılığı54 reklamda insan paneline karşı sıralama korelasyonu

İki gözlem var ve hiçbiri hangi ürünün daha iyi olduğu ile ilgili değil.

En yüksek rakam bir doğruluk rakamı değildir. Fairgen'in %98'i, üretilen profillerin kendi altı boyutlu kalite kapısından geçen payıdır. Bu, çıktının insan verileriyle eşleşip eşleşmediği hakkında hiçbir şey söylemez ve Fairgen bunun böyle olduğunu iddia etmez. Bu tabloyu yüzdeye göre sıralayan herkes, asla girmedikleri bir ölçümde birinci sıraya yerleşir.

Sadece iki rakam karşılaştırılabilir. Simile'in %85'i ve Artificial Societies'in %86'sı, insanların kendilerinin başardığına göre ifade edilmiştir. Bunlar karşılaştırılabilir. Kolondaki başka hiçbir şey birbirleriyle, hatta kendileriyle bile karşılaştırılamaz.

Başarısızlıkları kim yayınlıyor

Bu, alanın en keskin şekilde ayrıldığı yerdir.

Fairgen, yöntemlerinin uygun olmadığı çalışmaları belirtmektedir: marka takibi, segmentasyon, conjoint. Rehberleri, "sahaya çıkmadan önce baskı testi yapın, bunun yerine değil" şeklindedir. Synthetic Users, kalibrasyon olmadan sentetik katılımcıların "bireysel olarak inandırıcı, ancak topluca yanlış" olduğunu belirtmektedir. Articos ve Evelance, çıktılarının yönlendirici olduğunu ve insan araştırması ile birlikte yer alması gerektiğini, yerini alması gerektiğini söylemektedir.

Aaru, Evidenza ve Artificial Societies, bulabildiğimiz hiçbir başarısızlık koşulu yayınlamamaktadır.

Nerede duruyoruz, aradaki fark dahil

Kendi çalışmalarımız dört koşul ablatörleri kullanıyor, gerçek yanıtları dışarıda tutuyor, hedefler açılmadan önce aday seçimlerini mühürlüyor ve sonucu yanında şans tabanını raporluyor. Bir GSS madde setinde, arkasında hiçbir model olmadan düz bir dağılım zaten %83.71 puan alıyor; bizim %92.47'imiz kalan mesafenin %54'ünü kapatıyor. Taban, yüzde ile yan yana olmalıdır ve genellikle eksiktir.

Çalışmayan sonuçlar yayınlıyoruz. Kayıtlı bir profil artışı 0.17 puan, -1.00 ile +1.31 arasında %95 aralığına sahipti, sıfırı geçti ve tanıtım kriterini geçemedi. Kısa günlük istemlerde kör bir karşılaştırmada, hedef kitlelerimiz, genel istemler için %30.5 ve demografik istemler için %34.0'a karşı %13.8 kazandı. Bu bir kayıptır ve yayınlanmıştır.

Sahip olmadığımız şey hakemli incelemedir. Simile'in ince ayar sonucu, EMNLP 2025'te 2.9 milyon yanıt içeren açık bir veri seti ile ortaya çıktı. Artificial Societies, British Journal of Psychology'de grup davranışı sonucu yayınladı. Bizim ise ikisi de yok. Doğrulama çalışmalarımız kendi sitemizde yayınlanmıştır ve dış incelemeden geçmemiştir, ve geçene kadar bir okuyucu bunu farklı bir şekilde değerlendirmekte haklıdır.

SINUS-Enstitüsü ile olan ortaklığımız bazen doğrulama olarak okunmaktadır. Bu doğru değildir. Bu, köken: persona modelimizin temellendiği ortam, onların araştırmalarının on yıllarına dayanmaktadır, bu da doğruluk hakkında değil, girdiler hakkında bir ifadedir. Yönetici direktörleri bunu açıkça ifade ediyor: Milieu-Minds "ne sosyal araştırmayı ne de enstitümüzün uzmanlığını değiştirmiyor".

Herhangi bir sağlayıcıyı on dakikada nasıl kontrol edersiniz

Metrik tanımını, örnek boyutunu, temel değeri ve başarısızlık koşullarını isteyin. Aynı ölçümün arkasında hiçbir model olmadan ne puan aldığını sorun. Eğer bir sağlayıcı bunları üretemiyorsa, yüzde pazarlamadır, kim yayınladıysa ve ne kadar olumlu görünüyorsa görünsün.

Bu test bizim için de rahat değildir. Bu, alıcıya bir şey söyleyen tek testtir.

Kaynaklar

Yukarıdaki tüm rakamlar, 22 Eylül 2026'da alınan ilgili sağlayıcının kendi kamuya açık materyalinden alınmıştır. İddialar değişir; güvenmeden önce kaynağı kontrol edin. Sizinkini yanlış okuduysak, bize bildirin, düzeltelim.

Sıkça sorulan sorular

Sentetik hedef kitleler ne kadar doğrudur?

Tek bir rakam yoktur. Yayınlanan rakamlar %85 ile %98 arasında değişiyor, ancak bunlar farklı şeyleri ölçüyor: tema örtüşmesi, dağılım uyumu, yanıt tutarlılığı, kalite geçiş oranları ve sıralama korelasyonu birbirinin yerine geçmez. Bir doğruluk rakamı yalnızca metrik, temel değer ve ölçüm yapılan görevle birlikte anlamlıdır.

İki sağlayıcının doğruluk yüzdelerini neden karşılaştıramıyorum?

Çünkü paydalar farklıdır. Bir sağlayıcı, uzman raporlarından kurtardığı tema payını bildirebilir, diğeri bir yanıt dağılımını eşleştirdiği payı, bir diğeri ise üretilen profillerin iç kalite kapısından geçen oranını bildirebilir. Bu rakamları birbirleriyle sıralamak, anlamsız bir sıralama üretir.

İnsan tavanı nedir ve neden önemlidir?

İnsanlar kendi anket yanıtlarını mükemmel bir şekilde yeniden üretmezler. İki hafta sonra tekrar sorulduğunda, kendilerinden farklıdırlar. Bu kendilik tutarlılığı oranı, herhangi bir simülasyon için gerçekçi bir tavandır, bu nedenle bir sonucu bunun payı olarak bildirmek, ham bir yüzdeden daha bilgilendiricidir.

Şans tabanı nedir?

Bir yaklaşımın arkasında hiçbir model ve veri olmadan elde ettiği puandır. Bizim GSS madde setlerimizden birinde, arkasında hiçbir model olmadan düz bir dağılım zaten %83.71 puan alıyor. Bu nedenle bildirilen %92.47, o taban ile mükemmel bir puan arasındaki mesafenin %54'ünü kapatıyor, bu da 'yüzde 92 doğru' iddiasından çok farklı bir iddia.