Yapay persona paneli, personasız modelden daha kötü tahmin etti
Pazarlamada hızla yayılan bir alışkanlık var: bir başlığı ya da reklam metnini yayına vermeden önce, büyük bir dil modeline hedef kitleyi temsil ettiği varsayılan birkaç “sentetik persona” tanımlamak, her personaya metni okutmak ve panelin beğendiği sürümü seçmek. Mantığı basit — canlı test pahalı ve yavaş, model ise anında ve ucuz cevap veriyor.
arXiv’de yayımlanan ve henüz hakem denetiminden geçmemiş bir çalışma, bu alışkanlığı gerçek davranış verisine karşı sınadı. Sonuç, yöntemin temel varsayımının tersi yönde çıktı: personaları tamamen kaldırıp modele doğrudan “tipik bir okur buna tıklar mı?” diye sormak, demografik olarak kurgulanmış on kişilik persona panelinden belirgin biçimde daha iyi tahmin üretti.
Ölçüm nasıl kuruldu
Çalışmanın dayandığı veri, Upworthy Research Archive adlı açık arşiv. Bu arşiv, aynı gerçek trafiğe gösterilmiş rakip başlık varyantlarını ve her varyantın ölçülmüş tıklama oranını içeriyor; yani “hangi başlık kazandı” sorusunun gerçek cevabı elimizde. Araştırmacılar, robotikten ödünç aldıkları “simülasyondan gerçeğe” (sim-to-real) çerçevesini kullanıyor: simülasyonda ölçülen davranış, gerçek dünyaya ne kadar taşınıyor?
Filtrelerden sonra, 1.695 A/B testine dağılmış 6.978 başlık varyantı elde kaldı. On personalık panel, ABD’de 2013-2015 döneminde sosyal medyadan haber tüketen kitlenin Pew Research verileriyle raporlanan yaş, cinsiyet ve platform dağılımına göre yazıldı; modele, her personanın ağzından “bu başlığa tıklama olasılığın nedir?” diye soruldu ve 0 ile 1 arasında bir sayı istendi. Personasız temel model ise tek bir genel okur tanımıyla, aynı sorgu bütçesiyle çalıştırıldı.
Kritik nokta: mutlak tıklama oranı değil, aynı test içindeki sıralama değerlendirildi. Bir metin simülatörünün oranı doğru bilmesi gerekmiyor; varyantları gerçek kitlenin sıraladığı gibi sıralaması yeterli.
Birinci bulgu: asıl darboğaz model değil, veri
1.695 testin yalnızca 399’unda (yüzde 23,5) birinci başlık, ikinciyi istatistiksel olarak anlamlı biçimde geçiyordu. Kalan dörtte üçte fark gürültüden ayırt edilemiyor.
Bu, çalışmanın belki de en az konuşulan ama en pratik sonucu. Eğer gerçek kazananın kim olduğu belli değilse, hiçbir tahmin aracı doğru cevabı bulamaz — çünkü ortada doğru cevap yoktur. Bir tahmin yöntemini bu tür testler üzerinde “doğrulamak”, gürültüye karşı ölçüm yapmak anlamına gelir. Çalışma bu yüzden asıl analizi yalnızca 399 güvenilir teste sınırlıyor.
İkinci bulgu: personalar sinyali bozuyor
Bu güvenilir alt kümede personasız temel yaklaşım, Kendall τ katsayısında 0,361 (yüzde 95 güven aralığı 0,289-0,430) değerine ulaştı — Cohen’in ölçütlerine göre orta büyüklükte bir etki. En iyi varyantı birinci sırada bilme oranı yüzde 49,2 idi; rastgele tahminin beklenen başarısı yüzde 30,4.
On personalık panel ise τ = 0,084 ve birinciyi bilme oranı yüzde 34,6’da kaldı. Panelin birinciyi bilme güven aralığı rastgele tahmin seviyesini kapsıyor; yani tek en iyi varyantı güvenilir biçimde seçemiyor. İki yöntemin güven aralıkları hiçbir ölçütte örtüşmüyor.
Araştırmacılar bunun bir “havuzlama” hatası olup olmadığını da test etti: aynı persona cevapları altı farklı kuralla birleştirildi — ortalama, medyan, sıralama birleştirme (Borda), ikili çoğunluk (Condorcet) ve normalizasyon dahil. Hiçbiri temel modelin başarısına yaklaşamadı. Panelin varyantlar arasındaki puan yayılımı da temel modelinkiyle aynı (0,054). Yani personalar kararsız kalmıyor; sistematik olarak yanlış sıralıyor.
Sonuç tek bir modele de bağlı değil: üç ayrı Gemini kademesinde ve farklı bir aileden OpenAI gpt-4.1’de tekrarlandı (τ 0,300’e karşı 0,082). Üç bağımsız Upworthy bölünmesinde aradaki fark 0,28-0,32 bandında kaldı.
Neden böyle olabilir
Çalışmanın önerdiği açıklama şu: model, neyin tıklandığına dair nüfus düzeyinde işe yarar bir ön bilgiye zaten sahip — çünkü eğitim verisinde tıklanma örüntüleri bol. “Sen 68 yaşında bir emeklisin” demek ise görevi birinci tekil şahıs rol yapmaya çeviriyor ve bu ön bilginin yerine klişeleşmiş bir tahmin koyuyor. On personanın ortalaması bunu kurtarmıyor, çünkü cevaplar rastgele gürültülü değil, yanlı.
Bu okumanın pratik karşılığı şu: personasız sorgu aslında tek bir “ortalama persona” demek. Kitleyi demografik parçalara ayırmak, toplam davranışı tahmin etmek gibi bir görevde her parçaya rol yapma yanlılığı ekliyor ama karşılığında yeni bilgi getirmiyor.
Burada kavramsal bir ayrım da netleşiyor. Political Analysis‘te yayımlanan ve “silikon örneklem” fikrini popülerleştiren çalışma, demografik geçmişlerle koşullandırılmış GPT-3’ün insan alt gruplarının anket cevap dağılımlarını yakınsayabildiğini gösteriyordu. Yeni çalışma bu bulguyla çelişmiyor; başka bir şeyi ölçüyor. Beyan edilen tutumların dağılımını üretmek ile ölçülmüş toplu davranış için tek bir nokta tahmini yapmak farklı işler ve ikincisinde koşullandırma işe yaramıyor.
Nerede geçerli, nerede değil
Personasız yaklaşımın üstünlüğü, sonucun gerçekten metne bağlı olduğu yerlerde ortaya çıkıyor. MIND haber veri setinde — burada karşılaştırılanlar aynı haberin başlık varyantları değil, aynı konudaki farklı makaleler — yön aynı ama fark yalnızca 0,038. Reddit’te aynı görselin farklı başlıklarla tekrar paylaşıldığı örneklerde ise her iki yöntem de τ ≈ 0 veriyor: orada oyları paylaşım saati ve görünürlük belirliyor, başlık değil.
Çekinceler
- Çalışma ön baskı; hakem denetiminden geçmedi.
- Model “tıklama niyeti” beyan ediyor, arşiv ise gerçekleşmiş tıklamayı ölçüyor. Bu kavramsal boşluk ulaşılabilir başarıya üst sınır koyuyor.
- Yazarlar küçük örneklemli bir pilotun etkiyi yaklaşık iki kat abarttığını, tam örneklemde τ’nun 0,084’e düştüğünü açıkça raporluyor.
- Veriler 2013-2015 dönemine ait İngilizce editoryal başlıklar. Modelin bu arşivi eğitim verisinde görmüş olma ihtimali dışlanamıyor; yazarlar bunu açık bir tehdit olarak işaretliyor.
- Yazar, metin simülasyonu araçlarında ticari çıkarı olduğunu bildiriyor ve bunu ön kayıtlı etki eşikleri ile tam bir tekrarlanabilirlik paketiyle dengelediğini belirtiyor.
- Bulgular reklam metnine, açılış sayfalarına, başka dillere ve güncel kitlelere genellenmemiştir.
Çalışmanın kendi çıkardığı sınır da net: bu sonuç, personaların segmentasyon ya da niteliksel itiraz bulma gibi heterojenliğin önemli olduğu amaçlarda değersiz olduğu anlamına gelmiyor. Yalnızca, metinleri beklenen tıklamaya göre sıralamak söz konusu olduğunda, bugün itibarıyla kullanmamaktan daha kötü olduklarını söylüyor.
Kaynaklar
- Do Synthetic Personas Predict Real Audience Response? A Sim-to-Real Study Where a No-Persona Baseline Beats Persona-Based Copy Simulation (arXiv ön baskısı)
- Argyle ve diğerleri, “Out of One, Many: Using Language Models to Simulate Human Samples”, Political Analysis
- Cheng, Piccardi ve Yang, “CoMPosT: Characterizing and Evaluating Caricature in LLM Simulations”, EMNLP 2023