Yalnızca yönlendiriciyi eğitmek matematik başarısını artırıyor
Bir dil modelinin matematik başarısını yükseltmenin bilinen yolu, ağırlıklarını yeniden eğitmekten geçer. arXiv’de yayımlanan ve henüz hakem denetiminden geçmemiş bir ön baskı ise farklı bir yere bakıyor: modelin tamamı donmuş haldeyken, yalnızca hangi uzmanın çalışacağına karar veren küçük katman eğitildiğinde GSM8K başarısının 3,37 yüzde puan arttığı bildiriliyor. Üstelik aynı müdahalenin yan etkisi de var — model yanlış cevap verdiğinde daha az konuşuyor.
Uzman karması (Mixture-of-Experts, MoE) mimarisinin mantığı şu: modelin içine çok sayıda küçük alt ağ (“uzman”) yerleştirilir, ama her kelime parçası için bunların yalnızca birkaçı çalıştırılır. Kapasite büyür, işlem maliyeti büyümez. Bu düzende her şeyi bağlayan düğüm, seçimi yapan yönlendiricidir (router): sadece hesaplamayı dağıtmakla kalmaz, her katmanda hangi hesaplama yolunun kelimenin temsilini biçimlendireceğini de belirler.
Dondurulmuş bir modelde tek değişken
Deneylerin merkezinde OLMoE-1B-7B-SFT var: toplam 7 milyar parametreli, kelime parçası başına 1 milyar parametresi etkinleşen, 16 MoE katmanlı ve her katmanda 64 uzman barındıran bir model. Alışıldık düzende yönlendiricinin elindeki tek veri, o anki kelime parçasının gizli durum vektörü; bundan uzman başına birer skor üretiyor ve en yüksek skorlu sekiz uzmanı (k=8) işe koşuyor.
Çalışmanın itirazı bu tek girdiye. Gizli durum, kelimenin ne olduğu bilgisini bağlamdaki konumuyla iç içe taşır; yazarlar bu iki bilgiyi birbirinden ayırmayı, modele bilinçli bir tasarım tercihi olarak dayatmayı deniyor. Ayrıştırma aracı ise dikkat mekanizmasının zaten ürettiği ama yönlendiricinin hiç görmediği bir veri: dikkat ağırlıkları. Bu ağırlıklar kelimenin ne olduğunu değil, modelin nereye baktığını söyler — hangi konumları önemsediğini, hangilerini atladığını, odağın nerede toplandığını.
Dikkat-Farkında Yönlendirme (Attention-Aware Routing, AAR) adı verilen yöntem, seçilen katmanlarda standart yönlendiricinin yanına ikinci bir modül koyuyor. Bu modülün girdisi, kelimenin kendisinden önceki son M konuma dağıttığı dikkat ağırlıklarından oluşan kayan bir pencere; ağırlıklar dikkat başları arasında ortalanıyor, dizinin başında pencere dolmadığında soldan sıfırla tamamlanıyor ki uzunluk sabit kalsın.
Pencere iki ayrı görünüşle işleniyor. Birincisi ham zaman serisi. İkincisi, serinin ayrık Fourier dönüşümünden alınan genlik değerleri — gerekçesi teknik ama anlaşılır: tek bir doğrusal katman ham diziden periyodik yapıyı kendi başına çıkaramaz, frekans görünümü bu yapıyı kaymaya duyarsız biçimde önceden açığa serer. Her görünüşün kendi bloğu var, görünüşler arası ağırlık yok ve her biri gizli duruma bakan bir “güven katsayısı” ile ölçekleniyor. Bu katsayı sıfırlandığında sistem birebir standart yönlendirmeye dönüyor.
Kritik ayrıntı karşılaştırmada. AAR yalnızca orijinal modelle değil, aynı veriyle aynı süre boyunca sadece yönlendiricisi eğitilmiş ama ek modülü olmayan sürümlerle de kıyaslanıyor. Böylece ek eğitimin katkısı ile dikkat sinyalinin katkısı birbirinden ayrılıyor.
Rakamlar
En iyi GSM8K sonucu, 9 ile 15 arasındaki katmanlara M=40 penceresiyle uygulanan tam AAR’den geliyor: 55,36 ± 0,74. Yalnızca yönlendirici eğitilen temel çalıştırmaya göre fark 3,37 yüzde puan. Yalnızca zaman görünüşünü kullanan sade sürüm bile M=20’de 51,99’u 54,57’ye taşıyor; frekans görünüşü bunun üzerine ekliyor. GSM8K’deki kazanım Qwen1.5 üzerinde de tekrarlanıyor.
Kazanım tek bir sınava bağlı değil: OLMoE MATH-500’de 2,64 yüzde puan iyileşiyor. Daha büyük ölçekte de sönmüyor — 40 katmanlı, 3 milyar etkin / 35 milyar toplam parametreli Qwen3.6-MoE’de yalnızca 23, 27 ve 31. katmanlara, mimariye özel hiçbir ayar yapılmadan ve 12,8 bin örnekle eğitilerek MATH-500’de üç tohum üzerinden 1,13 yüzde puan elde ediliyor. Matematik dışındaki sınavlarda — BBH, HumanEval, IFEval — tablo gürültü aralığında, yani değişmiyor.
Eğitim tarafında bildirilen tek maliyet rakamı şu: CINECA’da barındırılan Leonardo süper bilgisayarında 4×A100 64GB GPU ile tek bir OLMoE çalıştırması yaklaşık 4 GPU saati sürüyor. Veri olarak Tulu3’ün %25’lik örneklemi (yaklaşık 220 bin örnek) kullanılmış, her yapılandırma 5 rastgele tohumla tekrarlanmış. Çalışma bu süreyi başka bir ince ayar yöntemiyle karşılaştırmıyor.
Aynı reçete her katmanda çalışmıyor
Yöntemin en net sınırı, nereye uygulandığıyla ilgili. AAR bütün katmanlara birden uygulandığında MMLU ortalaması 2,1 yüzde puan geriliyor. Ama kayıp her yere dağılmıyor: matematik ve bilgisayar bilimi gibi akıl yürütme ağırlıklı konular korunuyor, hatta iyileşiyor; biyoloji, tarih ve felsefe gibi bilgi geri çağırmaya dayanan konular tutarlı biçimde düşüyor. İkisini birlikte gerektiren ekonomi ve fizikte ise en iyi sonuç, müdahale 7–11. katmanlar civarından başlatıldığında alınıyor.
Yazarların okuması şu: sığ katmanlar olgusal arama için kritik ve bu tür değişikliklere karşı kırılgan; belirli bir derinlikten sonra geri çağırmaya dair yapı oturmuş oluyor ve müdahale onu bozmuyor. Bu “geri çağırma–akıl yürütme gerilimi”, katman seçimli AAR’i aynı zamanda bir ölçüm aracına dönüştürüyor: dikkat ağırlıklarının hangi derinlikte hangi tür bilgiyi taşıdığını, yönlendirmeyi oynatıp sonucu okuyarak test etmek mümkün oluyor. Pratik tavsiye sade kalıyor — orta-derin katmanlar güvenli başlangıç noktası.
Yanlış cevaplar kısalıyor
Müdahalenin izi üretilen metinde de görünüyor. AAR’li ve AAR’siz model çiftleri GSM8K’de eşleştirildiğinde, her ikisinin de yanlış cevap verdiği durumlarda AAR sürümünün cevapları ortalama %11,8, dağılımın üst ucunda %14,9 kısalıyor. Her ikisinin de doğru cevap verdiği durumlarda uzunluklar ayırt edilemiyor. Yani model genel bir kısa konuşma alışkanlığı edinmiş değil; etki yalnızca yanlış yola sapıldığında ortaya çıkıyor ve model uzun bir muhakeme zincirini sürdürmek yerine erken bağlıyor.
Yönlendirme dikkati nasıl yeniden şekillendiriyor
Model içindeki iz ise bir katman gecikmeli. Dikkat mekanizmasına tek bir doğrudan güncelleme yapılmadığı halde, “dikkat çukurları” (attention sink) — dikkat kütlesinin dizinin ilk kelimesi üzerinde yoğunlaşması — güçleniyor. Gecikme bulguyu AAR’e bağlayan şey: müdahale hangi katmandan başlatılırsa, çukur güçlenmesi bir sonrakinde başlıyor.
Zinciri kurmak zor değil: yönlendirme kararı değişince hangi uzmanların hangi ağırlıkla çalıştığı değişiyor, bu da bir sonraki katmanın dikkat alt modülüne giden temsilleri değiştiriyor. Önceki çalışmalar dikkat çukurunun kod çözmeyi sabit bir çapaya bağlayarak kararlılaştırdığını göstermişti; burada model bu deseni yalnızca yönlendirme üzerinden pekiştiriyor. Yazarlar bunu matematik kazanımının olası mekanizmalarından biri olarak öne sürüyor, kanıtlanmış bir nedensellik olarak değil.
Yönlendiriciye ne verileceği eski bir soru
Yönlendiricinin eğitilebilir olmasının tek başına bir kazanç getirdiği daha önce gösterilmişti. EMNLP 2023’te sunulan bir çalışma, kümelenmiş sentetik veride yönlendiricinin küme yapısını öğrendiğini kuramsal ve deneysel olarak ortaya koyuyor; T5X ile yürütülen gerçek veri deneylerinde ise eğitilebilir bir yönlendiricinin eğitilemez olana kıyasla önemsiz olmayan bir avantaj sağladığını bildiriyor. Bu sonuç, yeni çalışmanın karşılaştırma tercihini de anlamlı kılıyor: AAR’in 3,37 puanı, hiç eğitilmemiş bir yönlendiricinin değil, zaten yeniden eğitilmiş bir yönlendiricinin üstüne ekleniyor.
Yönlendiriciyi gizli durumdan başka bir şeyle beslemek de ilk kez denenmiyor. Yeni çalışmanın kendi literatür özetine göre, yine EMNLP 2023’te sunulan HyperRouter, yönlendiricinin parametrelerini eğitilebilir bir gömme vektörüne koşullanan sabit ve rastgele başlatılmış bir hiperağ ile üretiyor; bu yolla temsil çöküşünü hafiflettiği, düşük entropili yönlendirme elde ettiği ve çıkarımda kullanılan uzman sayısını sınırladığı aktarılıyor. Başka bir hat, yönlendiriciyi katmanlar arasında paylaşılan bir yinelemeli birime bağlayarak önceki yönlendirme kararlarını da karara katıyor. AAR’in bu hatlardan ayrıldığı nokta, eklenen sinyalin türü: modelin kendi dikkat dağılımı.
Açık kalanlar
Yöntem dikkat ağırlıklarının açıkça hesaplanıp bellekte tutulmasını gerektiriyor; bu da AAR’in etkin olduğu katmanlarda FlashAttention gibi bellek-verimli uygulamaların devre dışı kalması demek. Yerine geçen yavaş alternatifin ek maliyeti, dizi uzunluğu ve AAR’li katman sayısıyla doğru orantılı büyüyor.
İkinci sınır deney tasarımından geliyor: bütün çalıştırmalar hâlihazırda talimat ayarı yapılmış modeller üzerinde yürütülmüş. Bu da en iyi katman aralığını modelin geçmiş eğitimine bağımlı kılıyor. OLMoE ve Qwen için en iyi aralıklar ikisi de orta-derin bölgede toplanmakla birlikte, kesin alt kümeler farklılaşabiliyor. Yazarlar sıfırdan ortak eğitimin bu farkı azaltabileceğini tahmin ediyor ama denemiş değiller.
Üçüncüsü, sinyalin kendi doğasından: dikkat serisinin otokorelasyonu, pencere 128’e çıkarılsa bile yaklaşık 20 kelimelik bir hafıza uzunluğunda doyuma ulaşıyor; bunun ötesinde ardışık ağırlıklar birbiriyle ilişkisizleşiyor. Yönlendiriciye daha uzun bir dikkat geçmişi vermek, ona daha fazla bilgi vermek anlamına gelmiyor — ölçümlerde de en iyi sonuçlar 20–40 arası pencerelerden geliyor.
Türkçe okur için bir not
Son olarak, kapsamın nerede bittiğini belirtmekte yarar var. Çalışmanın değerlendirmeleri GSM8K, MATH-500, BBH, MMLU, HumanEval ve IFEval ile sınırlı; çok dilli ya da Türkçe hiçbir ölçüm bildirilmiyor. Dolayısıyla buradaki kazanımların Türkçe akıl yürütmeye taşınıp taşınmadığı konusunda çalışma bir şey söylemiyor — bu soru açık.