·Validation·Minds Team

Sentetik Hedef Kitleleri Gerçeklikle Test Ettik

Beş kamuya açık anket veri setinin sentetik kitle doğruluğu hakkında ortaya koydukları, 301 Mind'lık Z kuşağı canlı ortam testi ve profil temellendirmenin nerede fayda sağladığı.

Sentetik araştırmaların harici bir referansa ihtiyacı vardır: gerçek insanların yanıtları. İlk araştırma paketimiz, sentetik yanıtları dört kamuya açık anket veri seti ve iki nitel kıyaslama ölçütüyle karşılaştırdı. Daha sonra yapılan Food and You canlı ortam testi aynı soruya pratik bir denetim ekledi: Kalıcı Minds'lardan oluşan bir kitle, gerçek bir anketin yanıt dağılımlarını ne kadar yakın şekilde yeniden üretebilir?

Sonuçlar iki farklı değer kaynağına işaret ediyor. Belirsizliği korumak, anket dağılımı tahminlerini iyileştiriyor. Katılımcı profilleri ve ilgili anılar ise bir yanıt birinin deneyimlerine, gerekçelerine ve değerlerine bağlı olduğunda ek değer sağlıyor. Bunların sağladığı faydalar göreve göre değişiklik gösteriyor.

Seçili anket replikasyonları

Ortalama dağılım hatası

Farklı anketler ve kohortlar; PISA ağırlıklıdır. Daha düşük hata daha iyidir. Bu sonuçları tek bir doğruluk puanında birleştirmeyin.

  • GSS 20247,53
  • ANES 20248,33
  • CES 20244,72
  • PISA 20226,20
  • Food and You 2, Wave 106,01
0Yüzde puan · düşük değer daha iyi10
Replike edilen çalışmaKamuya açık kaynak veri setiSonuç
GSS 2024 anket replikasyonuGSS 202492.47% yakınsama · 7.53 pp ortalama hata
ANES 2024 boylamsal replikasyonuANES 2024 Time Series Study91.67% yakınsama · 8.33 pp ortalama hata
CES 2024 ön/son replikasyonu2024 Canadian Election Study95.28% yakınsama · 4.72 pp ortalama hata
PISA 2022 uluslararası replikasyonuPISA 2022 Database93.80% yakınsama · 6.20 pp ağırlıklı ortalama hata
Food and You 2 üretim replikasyonuFood and You 2, Wave 1093.99% yakınsama · 6.01 pp ortalama hata · Pearson 0.804 · Spearman 0.834

Toplam yakınsama, 100 eksi ortalama mutlak yüzdelik puan hatası anlamına gelir. Yanıt dağılımları arasındaki farkı ölçer. Bireylerin aynı yüzdesinin doğru tahmin edildiği anlamına gelmez. Çalışmalar, ağırlıklı bir PISA sonucu da dahil olmak üzere farklı ölçüm araçları ve toplulaştırma ayrıntıları kullanır; bu nedenle satırların ortalaması tek bir doğruluk puanında birleştirilmemelidir.

İlk dört satır, orijinal izole anket deneylerine aittir. Beşincisi ise mevcut kilitli bir kohort üzerinde sonradan yapılan bir ürün çalıştırmasıdır. Bu satırın dahil edilmesi, söz konusu kohort üzerindeki bir tekrarlamayı yeni ve bağımsız bir popülasyon çalışmasına dönüştürmeden kanıt genel görünümünü genişletir.

Z kuşağı: ürün üzerinden gerçek bir anket

Birleşik Krallık Food Standards Agency'nin Food and You 2 anketi, gençlerin kahvaltı, öğle ve akşam yemeklerinde ne sıklıkla dışarıda yemek yediğini veya paket yemek aldığını sordu. Canlı ortam karşılaştırması, aynı üç soruyu 16 ila 24 yaşları arasındaki 301 kalıcı Minds'a yöneltti ve ortaya çıkan dağılımları yayımlanan gençlik sonuçlarıyla karşılaştırdı. Değerlendirilen her bir madde için insan katılımcı tabanı 257 idi.

Planlanan 903 yanıtın tamamı tamamlandı. 21 yanıt seçeneği hücresinde ortalama mutlak hata 6.01 yüzdelik puan, ortalama dağılım örtüşmesi ise %78.98 oldu. Bunlar farklı özellikleri tanımlar: yakınsama dönüşümü ortalama hücre hatasını özetlerken, örtüşme dağılımların ne kadar olasılık kütlesi paylaştığını gösterir.

18 Ağustos çalıştırması, aynı kohort ve ölçüm aracı kullanılarak 9 Ağustos sonucuna kıyasla iyileşme gösterdi: hata 7.33 puandan 6.01 puana gerileyerek göreceli olarak %18.0 oranında azaldı. Her soruda iyileşme görüldü. Bu karşılaştırma, eşzamanlı randomize bir karşılaştırmadan ziyade geçmiş bir kontrol grubuna sahip bir ürün regresyon testiydi.

Temel kıyaslama bağlamı önem taşır. Sabitlenmiş genel bir olasılık istemi 6.68 puanlık hata kaydetti ve eşit olasılıklı bir sıfır hipotezi aynı hücrelerde 7.00 puan kaydetti. Canlı ortam sonucu betimsel olarak daha iyiydi, ancak bu temel modeller eşzamanlı olarak yeniden çalıştırılmadı. Dolayısıyla, yakınsama ölçeğinde doksanlardaki bir puan tek başına büyük bir avantaj olarak yorumlanmamalıdır.

Z kuşağı gıda anketi makalesinin tamamı kitleyi, anketi, veri kaynağını ve soru bazındaki sonuçları açıklar. Food Standards Agency, kamuya açık referans veri setini sağladı; bu Minds çalışmasına sponsor olmadı, onay vermedi veya çalışmayı incelemedi.

Belirsizlik anket tahminlerini neden iyileştirdi

Orijinal dört anket deneyinde olasılık yanıtları, tek bir yanıta zorlamaya kıyasla dağılım hatasını 12.47 ila 19.72 yüzdelik puan azalttı. Bu iyileşme dört veri setinin tümünde görüldü.

Bir olasılık yanıtı, kategorik bir seçimin göz ardı ettiği belirsizliği korur. Bir kitle genelinde toplulaştırıldığında bu olasılıklar, her sentetik katılımcıdan alınan tek bir zorunlu seçime kıyasla popülasyon dağılımını daha yakın şekilde yeniden oluşturabilir.

Bu sonuç, yanıt toplama ve toplulaştırma ile ilgilidir. Aynı deneyler, ayrıntılı profillerin demografik olasılık istemlerini tutarlı bir şekilde geride bıraktığını göstermedi. Karşılaştırma yapılan temel model ve yanıt biçimi, nihai puan kadar önemlidir.

Diğer seçili doğrulamalar

Bu çalışmalar farklı çıktılar kullandığından bir yakınsama yüzdesi yanıltıcı olur. Bu veriler, anket kanıtlarının doğruluk aralığını genişletmek yerine onları tamamlar.

Çalışma ve ayrıntılı sonuçlarDeğerlendirilen örneklemBildirilen sonuçYakınsama
PRISM Alignment299 katılımcı, 869 madde%32.6 katılımcı uyumu kazanma oranı; %25.7 demografik ve %20.5 genelUygulanamaz
Held-out interviews22 kişi, 66 yanıt, iki derlemGenel, katılımcı kümelenmiş tahmine göre +24.37 bileşik puanUygulanamaz
Named foundation modelsAynı 22 kişi ve 66 yanıt, yeni bir kohort değilGPT-5.4 modeline kıyasla +25.49 puan; Claude Sonnet 5 modeline kıyasla +30.05Uygulanamaz
Spark creative diversityYedi yaratıcı görevDüzgün temel modele (3.14/10) kıyasla ortalama çeşitlilik 7.90/10Uygulanamaz

Spark, fikir çeşitliliğini değerlendirir; temsili bir anketle uyumu ya da gerçek reklam performansının tahminini değil. Mülakat karşılaştırmaları ise doğru simüle edilmiş kişilerin yüzdesini değil, otomatik hakemleri kullanır.

Katılımcı bağlamının fayda sağladığı yerler

İlk nitel testler, üretim sürecinden ayrı tutulmuş sonraki insan yanıtlarını değerlendirdi. PRISM Alignment karşılaştırmasında tam Minds, demografik istemler için %25.7 ve genel istemler için %20.5'e kıyasla %32.6'lık bir kör test kazanma oranı elde etti. Bu PRISM veri seti, Minds'ın kendi PRISM yaklaşımından farklı, harici bir kıyaslama ölçütüdür.

Bağımsız mülakat doğrulaması iki kamuya açık derlem, 22 kişi ve sonraki 66 yanıtı kullandı. Raporu, her iki derlemde ve ikinci bir hakem versiyonu altında genel istemlere kıyasla profil artı erişim yönünde pozitif bir avantaj tespit etti. İsimlendirilmiş model karşılaştırması, bu avantajı genel GPT ve Claude yanıtlarıyla inceliyor. Bu temel modellere katılımcı geçmişi verilmedi.

Bu deneyler katılımcı uyumu, gerekçeler, özgüllük ve ses tonu ile ilgilidir. Hakem puanları, anket dağılımı yüzdeleriyle birleştirilmemelidir. Her ikisi de sentetik katılımcının hangi kanıtı aldığına bağlıdır ve nitel değerlendirmeler hâlâ bağımsız insan değerlendiricilerin onayını gerektirir.

Kanıtların geçerlilik sınırları

Orijinal paket, anket ve nitel kıyaslama ölçütlerinde 1,881 katılımcıyı kapsıyordu. Ek 301 Mind'lık gıda çalıştırmasının kendi kohortu ve insan referans paydası vardır; bunlar ayrı tutulmalıdır.

Raporlanan testlerde hedef çıktılar çalışma zamanı girdilerinden ayrı tutuldu. Kamuya açık kaynak verileri modelin ön eğitiminde yine de yer almış olabilir; dolayısıyla çalışma zamanındaki ayrım, önceki tüm maruziyetlerin kesinlikle bulunmadığını kanıtlayamaz. Orijinal anket sonuçları da izole test ortamlarından elde edilmiştir; her ürün sürümünde birebir aynı davranışın sergileneceğini garanti etmez. PISA, beş ülkesinde İngilizce ana metin kurgusunu kullandı.

Bu genel bakış, Minds tarafından yürütülen her deneyin eksiksiz bir dökümünü değil, burada ele alınan onaylanmış kanıtları sunar. Diğer keşif amaçlı ve başarısız testler kendi bağlamlarını gerektirir. Bu bulguların pratik kullanımı; belirli bir soru için uygun hedef kitleyi, yanıt biçimini ve doğrulama yöntemini seçmektir.

İş akışı için Minds araştırma panellerinin nasıl oluşturulduğunu okuyun ve sentetik bir sonucun neleri destekleyebileceğine karar verirken doğrulama kontrol listesini kullanın.