LayerNorm ve RMSNorm: Gradiyen Akışı ve Eğitim Hızı

326 kelime3 dk okuma

RMSNorm, ortalama çıkarma adımını atlayarak yalnızca karekök ortalama büyüklüğü normalizasyonu yapar; bu, hesaplama ve bellek maliyetini düşürürken çoğu durumda eğitim kararlılığını korur.

Normalizasyon neden gerekli?

Çok katmanlı ağlarda aktivasyonların dağılımı katmanlar arasında kayabilir. Bu, gradyanların çok büyük veya çok küçük hâle gelmesine yol açar.

Normalizasyon katmanları, aktivasyonların ölçeğini her katmanda standartlaştırarak gradyan akışını kararlı hâle getirir. Bu, eğimin derinleştikçe bozulmasını engeller.

LayerNorm mantığı

LayerNorm, her tokenın özellik vektörü üzerinde çalışır. Önce ortalama çıkarılır, sonra varyans hesaplanır ve vektör bu değere göre ölçeklenir.

Yöntemin gücü, toplu boyuta bağımlı olmamasıdır. Bu, değişken uzunlukta dizilerle ve küçük parti boyutlarında çalışmayı mümkün kılar.

RMSNorm sadeleştirmesi

RMSNorm, ortalama çıkarma adımını tamamen kaldırır. Yalnızca karekök ortalama büyüklük hesaplanır ve vektör buna göre ölçeklenir.

Bu sadeleştirme, ortalama hesabı ve ona bağlı düzeltme işlemlerini ortadan kaldırarak hesap maliyetini azaltır. Ölçeklendirme katsayısı öğrenilebilir bir parametre olarak kalır.

Çalışma süresi farkı

Küçük modellerde RMSNorm'un getirdiği kazanç sınırlı olabilir. Ancak çok katmanlı, geniş modellerde her katmanda yapılan küçük bir tasarruf toplamda anlamlı bir süre oluşturuyor.

Bu nedenle birçok modern modelde RMSNorm tercih edilmiş. Özellikle çıkarım tarafında, daha kısa çalışma süresi doğrudan kullanıcı deneyimine yansıyor.

Pratik sonuç

Normalizasyon seçimi, modelin mimari kararlarından biridir. İkisi arasındaki fark genellikle küçük olsa da, ölçek büyüdükçe biriken etkiler belirginleşiyor.

Sonuçta RMSNorm, benzer kararlılık ile daha düşük maliyet sunduğu için yaygın bir tercih olmuş durumda. LayerNorm ise daha küçük ve daha basit modellerde hâlâ kullanılıyor.

  • Normalizasyon, gradyan akışını kararlı hâle getiriyor
  • LayerNorm ortalama ve varyans hesaplar
  • RMSNorm yalnızca karekök ortalama kullanıyor
  • Ölçek büyüdükçe RMSNorm tasarrufu birikiyor

Sık sorulan sorular

RMSNorm LayerNormdan neden daha hızlı?

Ortalama hesabı ve ona bağlı düzeltme adımlarını tamamen atladığı için daha az işlem yapar. Bu, özellikle çok katmanlı modellerde toplamda anlamlı süre kazandırır.

RMSNorm eğitim kararlılığını bozar mı?

Çoğu deneyimde kararlılığı koruduğu gösteriliyor. Ancak bazı durumlarda tam normalizasyonun daha iyi sonuç verdiği de raporlanıyor; bu durum model ve veriye bağlı.

Normalizasyon katmanı neden zorunlu?

Derin ağlarda aktivasyon ölçekleri katmanlar arasında kayabiliyor. Normalizasyon bu kaymayı engelleyerek gradyanların kaybolmasını veya patlamasını önler.

Hangi durumda hangisi tercih edilir?

Büyük ölçekli modellerde RMSNorm tasarrufu önemli kıldığı için tercih ediliyor. Basit ve küçük modellerde LayerNorm hâlâ yaygın biçimde kullanılıyor.

Kaynakça

  1. Root Mean Square Layer NormalizationarXiv
  2. Layer NormalizationarXiv
  3. Normalizasyon (makin öğrenmesi)Wikipedia
  4. Transformer mimarisiWikipedia
  5. Gradiyan inişiWikipedia

Bu konuyla ilgili haberler