FlashAttention Serisi: Bellek G/Ç Tıkanıklığının Çözümü
FlashAttention, dikkat softmax ara sonuçlarını HBM belleğe yazmak yerine işlemci içindeki SRAM da tutar ve veriyi parçalı biçimde işleyerek bellek trafiğini dramatik biçimde azaltır; hesaplanan sonuç matematiksel olarak aynıdır.
Darboğaz matematik değil
Standart dikkat uygulaması, ölçeklenmiş çarpımı önce belleğe yazar, orada satır bazlı softmax uygular, sonra ağırlıkları değerlerle çarpıp tekrar belleğe yazar.
Bu ara sonuçlar büyük ve geçicidir. Bellek bant genişliği sınırlı olduğu için işlemci çoğu zaman hesap yapmak yerine veri bekler. Darboğaz hesaplama değil, veri hareketidir.
Ana fikir
Softmax matematiksel yapısı, ara sonuçları hiç yazmadan sıralı bir toplamla hesaplanmasına izin verir. Bu, kayan bir birikimle gerçekleştirilebilir.
Bu kayan toplam kullanılarak ara sonuçlar SRAM da tutulur. Böylece yavaş belleğe yazılıp okunan veri miktarı çok azalır ve hesap birimleri veri beklemek yerine sürekli çalışır.
V2 katkısı
İlk sürüm, iş parçacığı sayısını ve veri sıralamasını iyileştirdi. Blok boyutlarının ayrılması, eşzamanlı çalışma verimliliğini yükseltti.
V2 ayrıca geriye dönük geçişin verimliliğini artırdı. Bu, eğitimde kazancın çıkarım kadar önemli olduğu anlamına geliyor.
V3 ve donanım uyumu
Üçüncü sürüm, yeni nesil donanımın asenkron yürütme modelini hedefler. Hesaplama ve veri taşıma işlemleri farklı iş parçacığı gruplarına bölünerek örtüştürülür.
Warp uzmanlaşması, farklı iş parçacığı gruplarına farklı roller verir. Bir grup üretim yaparken diğer grup veri taşıma hazırlığı yapar; boru hattı verimliliği belirgin biçimde artar.
Neden bu kadar önemli?
Uzun bağlamlı dikkat, bellek trafiğini uçurucu biçimde artırıyor. Bu sayede daha uzun bağlamlar ve daha büyük modeller aynı donanımda çalışabilir hâle geldi.
Bu, mimariyi değiştirmeden mevcut modellerin pratik çalıştırma maliyetini düşürdü. Araştırmacılar, mimari iyileştirme yerine bu tür sistem düzeyi çözümlerle de büyük kazançlar elde ediyor.
- Standart dikkette ara sonuçlar belleğe yazılıp okunur
- Softmax kayan toplamla yeniden yazılmadan hesaplanabilir
- SRAM da çalışmak, yavaş bellek trafiğini ciddi biçimde azaltır
- V3 asenkron yürütme ile hesap ve taşımayı örtüştürür
Sık sorulan sorular
FlashAttention softmax formülünü değiştiriyor mu?
Hayır. Hesaplanan sonuç matematiksel olarak aynıdır. Değişen şey ara sonuçların nerede ve nasıl saklandığıdır. Bu bir sistem düzeyi optimizasyonudur.
Neden SRAM kullanmak bu kadar etkili?
SRAM, yüksek bant genişlikli belleğe göre çok daha hızlı ama çok daha küçüktür. Ara sonuçları SRAM da tutmak, yavaş ve büyük belleğe yapılan her geçişi önler.
FlashAttention-3 neyi ekliyor?
Yeni nesil donanım için asenkron yürütme ve warp uzmanlaşması getiriyor. Hesaplama ve veri taşıma işleri farklı iş parçacığı gruplarına bölünerek örtüştürülüyor.
Bu yaklaşım kısa bağlamda da işe yarar mı?
Kısa bağlamlarda ara sonuçlar SRAM a sığabilir, dolayısıyla kazanç daha sınırlıdır. Ancak yine de daha az bellek erişimi sağlar ve kazanç tamamen ortadan kalkmaz.
Kaynakça
Bu konuyla ilgili haberler
- DeepSeek'ten Çıkarımda Devrim: Seyrek MoE, Multi-Head Latent Attention ve Engram Bellek Mimarisi
- 1 Milyon Token 3 Kuruşa İndi: DeepSeek-V4.1-Flash Bellek Tüketimini 4 Kat Düşürerek Çıktı
- Samsung HBM4 Seri Üretimine Başladı: 2 TB/s Bant Genişliği ile Yapay Zekâ Bellek Krizi Bitiyor
- Stanford ve DeepMind 'Synaptic Memory': Yapay Sinirlerde Kalıcı Bellek Katmanı