·Research·Minds Team

Sentetik Hedef Kitleler Genel Temel Modellerden Ne Zaman Daha İyi Performans Gösterir?

Ayrık mülakat karşılaştırması, katılımcı profillerinin ve hafızanın sentetik yanıtları genel GPT, Claude ve Gemini prompt'larına kıyasla ne zaman iyileştirdiğini test ediyor.

Bir temel model, bir mülakat sorusuna akla yatkın bir yanıt üretebilir. Ancak belirli bir kişinin tam olarak ne söyleyeceğini yeniden üretmek çok daha spesifik bir görevdir. Kişinin geçmiş deneyimleri, değerleri ve gerekçeleri, modelin akıcı ve genel bir yanıt üretme yeteneğinden çok daha belirleyici olabilir.

Bu ayrımı 22 kişiden alınan ve modelden saklanan (held-out) 66 mülakat yanıtıyla test ettik. Kompakt bir katılımcı profiline ve geçmiş mülakat kanıtlarına erişebilen sentetik bir katılımcı, körleştirilmiş katılımcı uyumu bileşiğinde genel GPT-5.4 ve Claude Sonnet 5 yanıtlarını geride bıraktı. Sağlanan birincil avantaj GPT'ye karşı 25.49 puan, Claude'a karşı ise 30.05 puan oldu. İkinci bir hakem model sürümü de bu pozitif karşılaştırmaları doğruladı.

Bu karşılaştırma, sentetik hedef kitlelerin spesifik bir kullanım alanını destekliyor: Yanıtı bu kanıtlara bağlı olan sorulara ilgili katılımcı kanıtlarını dahil etmek. Genel modeller herhangi bir katılımcı geçmişi almadı. Dolayısıyla bu çalışma, modellerin özdeş bağlam altındaki yetenek sıralaması değil; temellendirilmiş (grounded) bir iş akışı ile genel prompt yaklaşımının bir karşılaştırmasıdır.

Test: Önceki kanıtlar, sonraki yanıtlar

Kıyaslama çalışmasında, lazer diş hekimliği uygulayıcılarını ve mültecilerin gıda güvensizliğini ele alan iki kamuya açık mülakat veri seti kullanıldı. Önceki mülakat kanıtları kompakt profillere ve geri çağrılabilir hafızaya dönüştürüldü. Değerlendirme için kişi başına sonraki üç yanıt saklı tutuldu; böylece 22 kişiden 66 hedef yanıt elde edildi.

Her hedef soru için dört anonim aday yanıt oluşturuldu: profil artı bilgi getirme (retrieval), altta yatan aynı Gemini ailesi modelinden genel bir yanıt, genel GPT-5.4 ve genel Claude Sonnet 5. Aday yanıtlar puanlamadan önce mühürlendi ve hakemler yanıtları koşul etiketleri olmadan değerlendirdi.

Değerlendirme kriterleri; jeneriklik ve temelsiz kişisel iddiaların yanı sıra gerçek yanıtla uyum, bakış açısı ve değerler, gerekçeler, özgünlük, üslup ve uzunluk uyumunu inceledi. Bunlar katılımcı uyumunun boyutlarıdır; reklam dönüşümünün, genel zekanın veya doğru simüle edilen insan yüzdesinin ölçütleri değildir.

Ölçülen avantaj

Katılımcı uyumu bileşik puanı

22 kişi, değerlendirme için ayrılmış 66 yanıt. Birincil otomatik değerlendirici. Genel modeller katılımcı geçmişini almadı; bu, eşit bağlamlı bir model sıralaması değildir.

  • Profil + bilgi getirme67,66
  • Genel GPT-5.442,17
  • Genel Claude Sonnet 537,61
  • Genel Gemini35,24
0Puan / 100100
Profil artı bilgi getirme ile karşılaştırmaBirincil bileşik artışıKatılımcı kümelenmiş %95 bootstrap aralığıİkinci hakem artışı
Aynı model genel Gemini yanıtı+32.42 puan+23.93 ila +40.52+32.83 puan
Genel GPT-5.4+25.49 puan+15.99 ila +34.56+26.13 puan
Genel Claude Sonnet 5+30.05 puan+21.86 ila +38.12+30.68 puan

Birincil hakem değerlendirmesinde temellendirilmiş koşul bileşik skorda 67.66 puan alırken; genel GPT 42.17, genel Claude 37.61 ve aynı modelin genel yanıtı 35.24 puan aldı. Her iki veri seti de her iki hakem sürümü altında, adı geçen GPT ve Claude koşullarına karşı pozitif ortalama avantaj sergiledi.

İki hakem sürümü, maddelerin %81.8'inde kazanan konusunda hemfikirdi. Her iki hakem de Gemini ailesi modelleri olduğundan, bu durum bağımsız insan değerlendiriciler veya birbiriyle ilişkisiz hakem aileleri arasındaki uzlaşmayı değil, bu model ailesi içindeki sürüm duyarlılığını test eder.

Temellendirme neden fayda sağlayabilir?

En doğrudan açıklama, ilgili kanıtlara erişimdir. Genel bir model, eksik kişisel bağlamı genel örüntüleri kullanarak doldurmak zorundadır. Temellendirilmiş bir katılımcı ise kayıtlı deneyimlerden ve tercihlerden yararlanabilir.

Profesyonel bir kararla ilgili bir soruda, önceki kanıtlar kişinin kısıtlamalarını, geçmiş deneyimlerini ve bir seçeneği diğerine tercih etme nedenini ortaya koyabilir. Böylece yanıt, genel geçer ve makul tavsiyeler vermek yerine bu ayrıntıları yansıtabilir. Kıyaslama çalışmasında temellendirilmiş koşul, daha yüksek özgünlük ve gerekçe puanları aldı ve daha az jenerik olarak değerlendirildi.

Aynı modelin genel sürümüyle yapılan karşılaştırma burada kritik bir rol oynuyor. Altta yatan model ailesini sabit tutup profil ve bilgi getirme koşulunu değiştirmek, bu görevde eklenen temellendirme iş akışının bir avantaj sağladığını gösterir. Ancak bu iş akışının hangi parçasının kazanımın ne kadarına yol açtığını ayrıştırmaz. Profiller, bilgi getirme, ek bağlam ve ilişkili prompt kurgusu birlikte değiştirilmiştir.

Sonuçlar, ilgili hafızanın değeriyle tutarlıdır. Ancak daha fazla bağlam eklemenin her zaman fayda sağladığını veya depolanan her olgunun her yanıtta yer alması gerektiğini kanıtlamaz.

Avantaj ne zaman en akla yatkındır?

Bu kanıt, bir araştırma sorusunun kişisel geçmişe, önceden ifade edilmiş bir tercihe, somut bir deneyime veya bir kararın ardındaki gerekçelere dayandığı durumlarda doğrudan geçerlidir. Takip mülakatları ve kitle üyelerinin aynı önermeyi neden farklı yorumladığını keşfetmeye yönelik çalışmalar bu modele tam olarak uyar.

Uygulamada faydalı bir test şudur: Bu kişinin önceki yanıtlarını bilmek verilecek yanıtı kayda değer ölçüde değiştirebilir mi? Cevap evet ise, temellendirilmiş kanıtlar değerli olabilir. Bir soru yalnızca genel olgusal bilgi gerektiriyorsa, bu deney sentetik bir hedef kitlenin yetenekli bir genel modele karşı bir üstünlüğü olduğunu göstermez.

Mülakat kıyaslamasında dahi bu avantaj evrensel değildi. Keşif amaçlı derinlemesine düşünme (reflective) soruları kesitinde GPT, temellendirilmiş koşulun 10.75 puan üzerinde yer aldı. Bu kesit yalnızca üç kişiden alınan beş maddeyi içeriyordu; bu nedenle güvenilir bir görev sıralaması oluşturmak için çok küçüktür. Yine de ortalama kazanımın her türlü soruda bir galibiyet olarak yorumlanmasını engeller.

Anketler ayrı bir açıklama gerektirir

Against Reality anket genel bakışı, olasılık temelli yanıt toplamanın, zorunlu seçimli yanıtlara kıyasla toplu dağılımları tutarlı biçimde iyileştirdiğini ortaya koydu. Detaylı profiller ise eşleştirilmiş demografik olasılık prompt'larının ötesinde bu dağılımları tutarlı şekilde geliştirmedi.

Bu durum, adil bir temel model karşılaştırması için önemlidir. Olasılık temelli bir hedef kitleyi zorunlu seçimli genel bir modelle karşılaştırmak, temellendirmenin etkisiyle yanıt formatının etkisini birbirine karıştırır. Amaç artımlı temellendirme değerini ölçmek olduğunda, her iki yaklaşım da aynı yanıt sözleşmesine tabi tutulmalıdır.

Z Kuşağı gıda anketi testi daha dar kapsamlı nicel bir örnek sunuyor. Buradaki sonraki canlı üretim çalışması, dondurulmuş genel olasılık taban çizgisi için 6.68 puana karşılık 6.01 puanlık bir hataya sahipti. Genel taban çizgisi geçmişe dönük olduğu için 0.67 puanlık bu fark betimsel niteliktedir. Sentetik hedef kitlelerin anketlerde temel modelleri geride bıraktığına dair geniş kapsamlı bir iddiayı destekleyemez.

Bu karşılaştırmanın açık bıraktığı noktalar

Çalışma küçük ölçeklidir: iki veri seti, 22 kişi ve 66 yanıt. Bazı mülakatlar İngilizceye çevrildiğinden üslup ve tarzın ne anlama geldiği etkilenebilir. Model sürümleri ve örnekleme kontrolleri farklılık gösterdi ve adı geçen genel modeller hiçbir katılımcı kanıtı almadı. Eşit bağlamlı bir karşılaştırma, her modele aynı izin verilen kaynak materyali vermeli, yanıt sözleşmesini sabit tutmalı ve kalitenin yanı sıra ortaya çıkan maliyeti de raporlamalıdır.

Puanlama ayrıca önceki bir doğrulama çalışmasından alınan mülakat kanıt setini yeniden kullandı. Bu önceki karşılaştırma ile eldeki dört koşullu değerlendirme birbirinden bağımsız iki örneklem değildir. Gelecekteki tekrarlar yeni katılımcıları, farklı konu alanlarını, bağımsız insan değerlendirmelerini ve her sistemin hangi bilgiyi gördüğüne dair daha sıkı kontrolleri içermelidir.

Bu çalışmanın desteklediği iddia, evrensel olmasa da son derece kullanışlıdır: Bu saklı tutulan mülakat sorularında, katılımcı temelli sentetik bir hedef kitle, gerçek insanlarla test edilen model sürümlerinin genel yanıtlarına kıyasla çok daha iyi eşleşen yanıtlar üretti. İlgili kanıtlar, elde edilen avantajın merkezinde yer aldı.

Hedef kitle temellendirmesinin ardındaki iş akışı için Minds panellerinin nasıl oluşturulduğunu inceleyebilirsiniz. Doğrulama kontrol listesi, sentetik bir sonucun bir karar için gereken kanıtlarla nasıl ilişkilendirileceğini açıklar.

Referans veriler

De-identified, English Transcripts of 36 interviews

Transcription Data

CC BY 4.0