Mixture of Experts Mimarisi ve Seyrek Yönlendirme

330 kelime3 dk okuma

Mixture of Experts, bir yönlendirici ağ aracılığıyla her token için yalnızca az sayıda uzman katmanı seçer; böylece toplam parametre sayısı artarken token başına etkin hesaplama maliyeti yaklaşık sabit kalır.

Temel fikir

Yoğun bir modelde her token, tüm parametrelerden geçirilir. Bu, hesabı pahalı hâle getirir ve kapasite arttıkça maliyeti doğrusal biçimde büyütür.

MoE ise ağı bir dizi uzman ağa böler ve her token için yalnızca birkaç uzmanı seçer. Seçimi yapan küçük bir yönlendirici ağdır.

Neden seyrek?

Parametre sayısı modelin kapasitesini belirler. Ancak hesaplama maliyeti, yalnızca o token için gerçekten kullanılan parametrelerle orantılıdır.

Bu ayrım, toplam parametreleri büyütürken token başına maliyeti büyütmemeyi mümkün kılar. Sonuç, belirli bir hesaplama bütçesiyle daha geniş bir bilgi tabanı kapsayan modellerdir.

Yönlendirme stratejileri

En yaygın strateji, yönlendirici çıktısından en yüksek puanı alan birkaç uzmanı seçmektir. Bu, seyrek bir aktivasyon sağlar.

Yönlendirme sırasında bir kayıp fonksiyonu da eklenir. Bu, uzmanların aşırı yüklenmesini ve bazı uzmanların hiç kullanılmamasını önlemeye çalışır.

Uzmanlaşma meselesi

Uzmanlar kendi çalışma biçimlerine özgü işler üzerinde uzmanlaşır. Ancak bu uzmanlaşmanın keskin ve insan tarafından okunabilir olması beklenmez.

Çoğu modelde uzmanlar dilbilimsel açıdan anlamlı bölünmeler göstermez. Bu, yönlendirmenin bir uzmanlık değil, daha çok bir hesaplama yükü dağıtım mekanizması olduğunu düşündürüyor.

Altyapı zorluğu

Uzmanlar dağıtık sistemlerde farklı cihazlara yerleştirildiğinde, her token için doğru cihaza iletişim gerekir. Bu iletişim, MoEnin kazancını azaltabilir.

Bu nedenle verimli MoE çıkarımı için özel sunucu tasarımı gerekir. Ağ üzerinden uzmanlara dağıtım, bazı kurulumlarda darboğaz hâline gelebilir.

  • Yoğun modelde her token tüm parametrelerden geçer
  • MoE yalnızca birkaç uzmanı seçerek maliyeti sabit tutar
  • Yönlendirici küçük, uzman ağlar büyüktür
  • Dağıtık çalışmada ağ trafiği önemli bir darboğaz olabilir

Sık sorulan sorular

MoE neden daha az hesapla daha güçlü?

Çünkü token başına maliyet, toplam parametre sayısı değil o token için seçilen uzmanların parametreleridir. Bu, kapasiteyi artırırken maliyeti büyütmemeyi sağlıyor.

Uzmanlar gerçekten belirli konularda mı uzmanlaşıyor?

Bazı ölçüde, ancak çoğu modelde uzmanlaşma keskin ve insan tarafından yorumlanabilir değil. Yönlendirme, uzmanlıktan çok bir hesaplama yükü dağıtımı işlevi görüyor.

MoEnin en büyük mühendislik sorunu nedir?

Uzmanların farklı cihazlarda çalışması durumunda ağ trafiğinin yönetimi. Bu, özellikle çok düğümlü kurulumlarda hesap kazancını aşındırabiliyor.

Yoğun modellerden ne zaman iyidir?

Parametre sayısı çok büyük ancak hesaplama bütçesi sınırlı olan durumlarda. Ölçeklenebilir kapasite arayan tasarımlarda MoE doğal bir seçimdir.

Kaynakça

  1. Switch Transformers: Sparse ScalingarXiv
  2. Outrageously Large Neural Networks: Sparsely-Gated Mixture-of-ExpertsarXiv
  3. Karma uzman modeliWikipedia
  4. Seyrek matrisWikipedia
  5. Büyük dil modeli ölçeklemeWikipedia

Bu konuyla ilgili haberler