·Validation·Minds Team

ANES 2024: Sentetik Yanıtlar ile Sonraki İnsan Yanıtlarının Karşılaştırması

Seçim öncesi ve sonrası ANES karşılaştırması, 300 eşleştirilmiş katılımcıyı sonraki 28 yanıt üzerinden test ediyor; yanıt formatı ve katılımcı profili temellendirmesi için ayrı sonuçlar sunuyor.

ANES 2024 karşılaştırması, profilden çekilen olasılıksal yanıtlar kullanılarak %91.67 toplu yakınsama veya 8.33 yüzdelik puan ortalama dağılım hatası elde etti. Ölçülen en net iyileşme, olasılık çıkarımından geldi: Genel olasılıksal yanıtlar, genel zorunlu tercihlere kıyasla hatayı 12.47 puan düşürdü.

Modele önceden verilmiş yanıtları yeniden oluşturan bir karşılaştırmanın aksine bu tasarım, seçim öncesindeki katılımcı verilerini kullandı ve seçim sonrasında dışarıda tutulan yanıtları değerlendirdi.

Boylamsal test

Örneklem, eşleştirilmiş 300 katılımcı ve sonraki 28 sorudan oluşuyordu. İnsan hedefleri çalışma anındaki üretimden saklandı ve aday yanıtlar değerlendirme öncesinde mühürlendi. Koşullar; genel zorunlu yanıt, genel olasılıklar, demografik olasılıklar ve profilden çekilen verilerle desteklenen olasılıklar olarak ayrıldı.

Önceki veriler bir katılımcı hakkında bağlam sağlayabilir, ancak bu durum katılımcının sonraki yanıtını bilmekle aynı şey değildir. Zamansal ayrım, önceki bilgilerin bir sonraki ankete taşınıp taşınmadığını görmek açısından bu çalışmayı faydalı bir test haline getiriyor.

Dağılım sonuçları

Ortalama madde mutlak hatası

Bu çalışma için raporlanan sonuçlar. Tablo ve tartışma, kapsamı, temel karşılaştırmaları ve belirsizliği açıklar.

  • Genel zorunlu tercih22,782
  • Genel olasılık10,312
  • Demografik olasılık8,263
  • Profilden çekilen olasılık8,330
0Yüzde puan · düşük değer daha iyi30
KoşulOrtalama madde mutlak hatası
Genel zorunlu tercih22.782 pp
Genel olasılık10.312 pp
Demografik olasılık8.263 pp
Profilden çekilen olasılık8.330 pp

Nihai yakınsama dönüşümü 100 eksi 8.33 ile %91.67 sonucunu verir. Bu değer bireysel tahmin doğruluğunu veya seçim sonuçlarına dair bir tahmini değil, ortalama yanıt hücresi dağılım hatasını açıklar.

Genel olasılık ile genel zorunlu tercih karşılaştırmasında kaydedilen iyileşme 12.47 yüzdelik puan oldu. Değerlendirilen hiçbir maddede bu karşılaştırmada iki puandan fazla gerileme görülmedi. Dolayısıyla yanıt formatı sonucu, tekil bir maddenin ötesine geçti.

Temellendirme ve toplulaştırma farklı sorulardır

Profilden çekilen veriler, demografik olasılık istemlerine kıyasla toplu ortalama mutlak hatayı iyileştirmedi. Kaydedilen fark, sıfırı kesen bir aralıkla +0.046 hata puanı oldu. Betimleyici tablo da benzer şekilde demografik olasılığın hafif önde olduğunu gösteriyor.

Profiller bireysel Brier skorunu ve kesin doğruluğu mütevazı ölçüde iyileştirirken, kitle kalibrasyonunu hafifçe kötüleştirdi. Bu sonuçlar bir arada var olabilir: Bir bireyin yanıtını tahmin etmek ile bir kitlenin dağılımını yeniden oluşturmak farklı hedeflerdir. Yalnızca lehteki metriği seçmek çalışmayı yanlış yansıtmak olur.

Deneyin genel sonucu karışıktır. Olasılık çıkarımını desteklerken, profillerin sağladığı birincil artımlı toplu faydayı doğrulanmamış olarak bırakmaktadır.

Çıkarımlar ve kısıtlar

Ekipler, sentetik kitleleri karşılaştırmadan önce değerlendirme hedeflerini belirlemelidir. Bireysel yanıt görevi bireysel metrikler gerektirirken, kitle dağılımı görevi toplu kalibrasyona ihtiyaç duyar. Birindeki iyi bir puan, diğerinin yerine geçemez.

Bu çalışma, eğitilmiş eksiksiz üretim Mind akışını değil, yapılandırılmış seçim öncesi kanıtları kullanan izole bir test ortamını yansıtmaktadır. Değerlendirilen örneklem ve sonraki sorular, her siyasi kitle veya anket aracı için genel geçerlilik sağlamaz. Çalışma anında verilerin dışarıda tutulması, model eğitiminde kamuya açık verilere önceden maruz kalınmış olma ihtimalini ortadan kaldırmaz.

GSS pilotu bir diğer yanıt formatı karşılaştırmasını sunmaktadır. CES çalışması bu aracı çeşitli soru biçimlerine genişletmektedir. Kanıt genel bakışı ise puanlarını ve kapsamlarını ayrı tutmaktadır.

Referans veriler

ANES 2024