Sentetik Kitle Doğrulaması ve Doğruluk Oranlarının Karşılaştırması
Popülasyon, görev, referans veri, metrik ve model sürümü birebir aynı olmadığı sürece sentetik kitle doğruluk yüzdeleri sıralanamaz. Savunulabilir bir değerlendirme, pazarlama manşetlerini değil hata dağılımlarını ve karar uyumunu karşılaştırır.
Bugün sentetik kitle doğruluğuna ilişkin savunulabilir bir liderlik tablosu bulunmamaktadır. Electric Twin, Simile, Aaru, Artificial Societies ve Minds etkileyici rakamlar yayınlasa da bu sayılar tamamen farklı görevleri tanımlamaktadır. Bazıları anket dağılımlarını karşılaştırırken bazıları bir yapay zeka ajanını bir bireyin daha sonraki öz yanıtıyla karşılaştırmakta, bazıları sıra korelasyonunu bildirmekte, bazıları ise bir ağ sonucunu değerlendirmektedir. Bunları aynı puana sahipmiş gibi sıralamak analitik açıdan hatalı olur.
Doğru soru daha dar kapsamlıdır: Sabitlenmiş bir sistem; alıcı için önem taşıyan popülasyon, karar, dil, uyaran ve metrik genelinde ne kadar iyi performans göstermektedir? Bu durum, sonuç izolasyonu, önceden kaydedilmiş metrikler, alt grup raporlamaları, başarısızlık senaryoları ve sürüm kaynak takibi gerektirir.
Sağlayıcı yüzdeleri neden karşılaştırılamaz?
| Boyut | Neler farklılık gösterebilir | Skoru neden değiştirir |
|---|---|---|
| Araştırma görevi | Anket replikasyonu, müdahale tahmini, öz yeniden test, kreatif kazananı, ağ yayılımı | Her biri farklı bir yeteneği test eder |
| Referans | İnsan anketi, gözlemlenen davranış, uzman görüşü, sonraki öz yanıt | Referanslar farklı gürültüye ve üst sınırlara sahiptir |
| Metrik | Ortalama mutlak hata, örtüşme, korelasyon, tam eşleşme, tutarlılık | Aynı çıktılar farklı şekillerde puanlanabilir |
| Popülasyon | Ulusal örneklem, müşteri paneli, niş segment, paydaş ağı | Kapsam ve alt grup zorluğu değişiklik gösterir |
| Maruz kalma | Kamuya açık veri seti, tescilli holdout verisi, müşteri verisi | Veri sızıntısı riski ve tekrarlanabilirlik değişir |
| Sistem sürümü | Model, sağlayıcı, prompt, bilgi alma, son işleme, popülasyon | İyileştirmeler veya gerilemeler herhangi bir katmandan kaynaklanabilir |
Sağlayıcı tarafından bildirilen bir sonuç, evrensel bir ürün niteliği olmasa da yararlı bir kanıt olabilir. Bu sonuçlar her zaman görevi ve metriğiyle birlikte alıntılanmalıdır.
Minds ne yayınladı?
Minds'ın mevcut kamuya açık uygulamalı kıyaslama çalışması, Birleşik Krallık Food Standards Agency'nin Food and You 2 çalışmasındaki üç öğün sıklığı dağılımını yeniden üretmiştir. Kilitlenmiş 301 kalıcı Z Kuşağı Minds kohortu, planlanan 903 yanıt üretmiştir. 21 yanıt seçeneği hücresi genelinde ortalama mutlak fark 6,01 yüzde puanı olmuş ve bu %93,99 toplulaştırılmış yaklaşım olarak ifade edilmiştir. Ortalama dağılım örtüşmesi %78,98, Pearson korelasyonu 0,804 ve Spearman korelasyonu 0,834 olarak gerçekleşmiştir.
Bu rakamlar yalnızca söz konusu ölçüm aracı için geçerlidir. Tam doğrulama raporu, bu sonucun bireysel tahmin doğruluğu, evrensel performans veya nedensel bir kanıt oluşturmadığını açıkça belirtmektedir. İnsan yüzdeleri ve kıyaslama dosyaları çalışma zamanının (runtime) dışında tutulmuştur; yine de model ön eğitimi veya kalıcı bilgi külliyatı aracılığıyla kamuya açık bir ankete dolaylı maruz kalma ihtimali tamamen göz ardı edilemez.
Rakipler ne yayınlıyor?
Electric Twin, 2026 doğruluk makalesi ve bir abone tabanından holdout verisi içeren bir Times vaka çalışması yayınlamıştır. Simile, haftalık olarak 7.000'den fazla değerlendirme genelinde doğrulama yaptığını ve bu değerlendirmeleri bir güven modelini eğitmek için kullandığını belirtmektedir. Aaru, bir EY varlık yönetimi çalışması da dahil olmak üzere göreve özel müşteri ve ortak vakaları yayınlamaktadır. Artificial Societies ise anket dağılımı ve yanıt tutarlılığı değerlendirmeleri paylaşmaktadır.
Bunlar anlamlı kamuya açık kanıt sinyalleridir. Ancak tahmin edilen büyüklükler ve referans noktaları farklı olduğu için tek bir sıralama olarak birbiriyle bağdaşmazlar. Alıcılar her sağlayıcıdan negatif sonuçlar ve alt grup kuyrukları dahil olmak üzere tam raporu talep etmelidir.
Adil bir karşılaştırmalı test (bake-off) tasarımı
- Hiçbir sağlayıcının inceleyemeyeceği bir insan veri setini dondurun.
- Her sağlayıcıya aynı popülasyon tanımını, uyaranları, soruları ve kaynak politikasını verin.
- Çıktıları almadan önce birincil ve ikincil uç noktaları tescil edin.
- Uygulanabilir olduğu yerlerde mutlak dağılım hatasını, dağılım örtüşmesini, kalibrasyonu, sıra uyumunu, alt grup hatasını ve etki yönü doğruluğunu ölçün.
- Yalnızca ortalamayı değil, her maddeyi ve alt grubu raporlayın.
- Platform, model, prompt, popülasyon, kaynak ve hesaplayıcı sürümlerini kaydedin.
- Maliyeti, geri dönüş süresini, hata oranını ve insan hizmet saatlerini ölçün.
- Kararlılığı test etmek için kayda değer bir model değişikliğinin ardından testi tekrarlayın.
Ağ simülasyonları için topluluk tespiti, yayılım doğruluğu ve müdahale etkileri gibi grafiğe özel uç noktalar ekleyin. Birleşik analiz (conjoint) veya fiyatlandırma yöntemleri için tahminciyi ve deneysel tasarımı sentetik yanıtların gerçekçiliğinden ayrı olarak doğrulayın.
Güven, doğruluk ile aynı şey değildir
Kalibre edilmiş bir güven katmanı, bir sonucun ne zaman doğru olabileceğini tahmin eder. Yalnızca güven düzeyi, holdout görevlerde gözlemlenen hatayı takip ettiğinde işe yarar. Yüksek güvene sahip yanlış yanıtlar, belirgin şekilde belirsiz olanlardan çok daha tehlikelidir.
Simile, tahmin edilen güveni konumlandırmasının merkezine yerleştirmektedir. Diğer platformlara kalibrasyon, belirsizlik veya kararlılık ölçümleri sunup sunmadıkları sorulmalıdır. Minds, desteklenen işlem hatları için yöntem tanılamalarını paylaşır ve uygulamalı doğrulamasıyla ilgili kısıtlamaları yayınlar; tek bir kıyaslamayı her çalışma için geçerli bir güven modeli olarak tanımlamamalıdır.
Model değişikliği kaynak takibi
Sentetik sistemler bağımsız olarak değişen katmanlara dayanır: öncü modeller, sağlayıcı API'leri, prompt'lar, bilgi alma, kaynak külliyatları, persona inşası, orkestrasyon, son işleme ve deterministik hesaplayıcılar. Electric Twin'in kamuya açık makalesi, API modeli geliştirmeleri de dahil olmak üzere birden fazla katmandan elde edilen kazanımları ele aldığı için değerlidir.
Alıcıların kanıt olarak kabul etmesi gerekenler
- Popülasyon, ölçüm aracı, holdout ve metrikleri içeren tarihli bir metodoloji.
- Zayıf maddeleri ve alt grup kuyruklarını içeren eksiksiz bir sonuç tablosu.
- Sağlayıcı tarafından hazırlanan, müşteri tarafından bildirilen, ortak tarafından incelenen veya bağımsız olarak tekrarlanan kanıtlar için net etiketler.
- Değişikliği açıklamaya yetecek sistem ve veri sürümü kayıtları.
- Kanıtın nerelerde genellenemeyeceğine dair bir beyan.
- Karar riskine göre uyarlanmış insan veya davranışsal doğrulama için bir sonraki adım planı.
Metrik, referans veya kapsam içermeyen niteliksiz bir “%X doğru” iddiasını reddedin. Akıcılık doğrulama anlamına gelmez ve daha büyük bir sentetik örneklem gerçek bir örneklem çerçevesi oluşturmaz.
İlgili kanıtlar
Sentetik kitle doğrulama kontrol listesi, veri kaynakları karşılaştırması, Minds araştırmaları, kantitatif işlem hatları karşılaştırması ve satın alma kontrol listesini birlikte kullanın.
Sıkça sorulan sorular
Hangi sentetik kitle platformu en doğrudur?
Kamuya açık kanıtlar tek bir evrensel kazananı işaret etmemektedir. Sağlayıcılar farklı görevler, veri setleri, metrikler, referans noktaları ve model sürümleri bildirmektedir. Adil bir yanıt, alıcının vereceği kararla eşleşen, sonuçlardan habersiz ortak bir kıyaslama (benchmark) gerektirir.
Minds çalışmasındaki %93,99 yaklaşım oranı ne anlama geliyor?
Bir Food Standards Agency anket replikasyonundaki 21 toplulaştırılmış yanıt seçeneği hücresi genelindeki ortalama mutlak yüzde puanı farkının %100'den çıkarılması anlamına gelir. Bu oran, bireysel tahmin doğruluğu veya evrensel bir ürün doğruluk oranı değildir.
Model değişiklikleri doğrulamayı nasıl etkilemelidir?
Model, sağlayıcı, prompt, bilgi alma (retrieval), popülasyon veya hesaplayıcı tarafındaki kayda değer değişiklikler kapsamlı bir regresyon testini tetiklemelidir. Sonuçlar ilgili sürümleri kaydetmelidir; böylece alıcı, performans artışını değişen ölçüm kurulumundan ayırt edebilir.


