Dikkatin Kendisi Lineerleştiriliyor: Sabit Bellekli Hibrit Mimari Dönemi
Gated Linear Attention, DeltaNet ve Kimi Delta Attention gibi varyantlar softmax dikkatini sabit boyutlu bir birikim durumuna indirgeyip uzun bağlamda karesel maliyeti ve büyüyen KV önbelleğini kesiyor; üretim modelleri ise bunu dikkati tamamen kaldırmak yerine tam dikkat katmanlarıyla hibrit (yaygın oran 3:1) diziyor.
Karesel tavan nerede?
Standart dikkat, her yeni token için geçmişteki tüm tokenlarla skor hesaplar. Bağlam iki katına çıkınca bu hesabın maliyeti dört katına çıkar; aynı zamanda her katmanın anahtar-değer önbelleği token sayısıyla birlikte büyür.
Durum uzayı modelleri bu tavanı dikkati kaldırarak aşıyor. Buradaki yaklaşım farklı: dikkati çöpe atmak değil, softmax’ını ve dolayısıyla bellek davranışını yeniden yazmak. Böylece dikkat ailesinin içinde lineer bir kol doğuyor.
Softmax’u kaldırmak
2020 tarihli “Transformers are RNNs” çizgisi softmax yerine ayrılabilir bir benzerlik çekirdeği koydu. Toplam sırası değişince dikkat, sabit boyutlu bir birikimle yazılabiliyor ve adım başına maliyet sabit kalıyor.
Sorun ifade gücünde çıktı: birikim durumu dolduğunda eski anahtarlar yenileriyle çarpışıyor, model neyi tutacağını seçemediği için uzun dizilerde kalite kaybı belirginleşiyordu.
Kapılar ve delta kuralı
Gated Linear Attention, bu birikim durumuna veriye bağlı bir unutma kapısı ekledi ve parçalı (chunkwise) formülle eğitimi donanım verimli hale getirdi. Model artık hangi bilginin silineceğini adıma göre ayarlayabiliyor.
DeltaNet ise belleği temizlemek yerine üzerine yazmayı seçti ve gelen anahtar-değer çiftini delta kuralıyla mevcut durumla uzlaştırıyor. Gated DeltaNet bu iki fikri birleştirdi; Kimi Delta Attention ise kapıyı kanal bazına indirip Ekim 2025’te hibrit bir üretim mimarisiyle yayımlandı.
Dikkat ile durum uzayı aynı yerden mi çıktı?
Mamba-2 kağıdı “Transformers are SSMs” başlığını taşıyordu: uygun biçimde yazıldığında dikkat ile yapılandırılmış durum uzayı geçişleri aynı matris ailesinden üreyebiliyor. İki kampta sayılan farklar, giderek aynı tasarım uzayının iki köşesi gibi okunuyor.
Bu kayma, pratikte hibrit tasarımları meşrulaştırdı. NVIDIA’nın Nemotron-H çizgisi Mamba-2 katmanlarına birkaç tam dikkat katmanı karıştırıp uzun bağlamda dönüştürme hızında Transformer akranlarına göre üç kata varan kazanç bildirdi.
Üretim modellerine geçiş
Qwen3-Next (Eylül 2025) bunu üretim ölçeğinde gösteren örneklerden biri: 48 katmanın her blokunda üç Gated DeltaNet katmanı bir Gated Attention katmanını izliyor, 80 milyar toplam parametrenin token başına yalnızca yaklaşık 3 milyonu aktif oluyor ve bağlam doğal olarak 256 bin tokena kadar destekleniyor. Geliştirici ekibi, 32 bin tokenın üzerindeki bağlamlarda daha küçük bir dense modele karşı on kata varan çıkarım hızı ve eğitim maliyetinin yaklaşık onda birini bildirdi.
Moonshot’ın Kimi Linear’ı aynı mantığı 48 milyar toplam / 3 milyar aktif parametre ölçeğinde 3:1 oranıyla kurdu ve önbellek ihtiyacını yüzde 75’e kadar düşürdüğünü, bir milyon tokenlık bağlamda dönüştürme verimini altı kata kadar artırdığını raporladı. Yani pazarlık, dikkati kaldırmak değil, seyreltmek.
- Softmax kaldırılınca dikkat sabit boyutlu duruma indirgenebiliyor
- Kapılar ve delta kuralı ifade gücünü geri getirdi
- Mamba-2 dualitesi dikkat ile SSM arasındaki sınırı sildi
- Üretim hibritleri üç lineer katmana bir tam dikkat katmanı koyuyor
Sık sorulan sorular
Lineer attention ile Mamba aynı şey mi?
Hayır. Mamba dikkatin yerine sabit boyutlu bir durum geçişi koyuyor. Lineer attention çizgisi ise dikkatin kendisini softmax’suz yazıp anahtar-değer birikimini sabit boyutlu bir duruma indirgiyor. Mamba-2’nin gösterdiği dualite iki çizgiyi yakınlaştırıyor, ama tasarımlar aynı değil.
Neden tamamen lineer bir model yapılmıyor?
Sabit durum geçmişi özetlemek zorunda kaldığı için, uzun bağlamda tam olarak hangi tokena bakacağını bilen görevlerde geride kalıyor. Üretim modelleri bu yüzden birkaç tam dikkat katmanı bırakıyor; böylece geri çağırma yeteneği korunup önbellek maliyeti seyreltiliyor.
Kazanç nerede ölçülüyor?
İki yerde: önbellek miktarında ve uzun bağlamda dönüştürme veriminde. Kimi Linear önbelleğin yüzde 75’e kadar azaldığını, Qwen3-Next on kata varan hız ve maliyetin yaklaşık onda biri bildirdi.
Kalite düşüyor mu?
Saf lineer modellerde düşebiliyor; hibrit tasarımlarda hedef bu kaybı kapatmak. Kimi Linear kendi hibrit düzeninin tam dikkat kuran akranlarını bazı görevlerde geçtiğini, Qwen3-Next ise kaliteyi korurken maliyeti kestiğini savunuyor. Sonuç görev türüne göre değişiyor.
Kaynakça
- Kimi Linear: An Expressive, Efficient Attention ArchitecturearXiv
- MoonshotAI/Kimi-LinearGitHub
- vLLM Now Supports Qwen3-Next: Hybrid ArchitecturevLLM
- Transformers are SSMs: Generalized Models and Efficient AlgorithmsarXiv
- Gated Delta Networks: Improving Mamba2 with Delta RulearXiv
- Nemotron-H: A Family of Accurate, Efficient Hybrid Mamba-Transformer ModelsNVIDIA Research
Bu konuyla ilgili haberler
- DeepSeek Harness Neden Gündemde? Yüzde 99,9 Önbellek Vuruşuyla Token Maliyetlerini Sıfırlayan Mimari
- Kuantum-Yapay Zekâ Hibrit Mimarileri: QPU Destekli LLM Ön Eğitimi Nasıl Çalışır?
- Moonshot AI'ın 2.8 Trilyon Parametreli Yeni Dev Mantık Modeli: Kimi K3 Özellikleri, Mimari Yenilikleri ve Benchmark Başarısı
- Kimi K3 Mimarisinin Sırrı: Delta Attention ve Attention Residuals