SLM Devri: Akıllı Verinin Ham Gücü Dar Alanlarda Yendiği Yer

576 kelime3 dk okuma

Küçük dil modeli isyanı daha çok parametre yerine daha iyi veri ilkesine dayanıyor: 1,3 milyar parametreli Phi-1 sentetik ders kitabı verisiyle HumanEval’de %50,6’ya çıktı, 3,8 milyarlık Phi-3-mini MMLU’da %69 ile GPT-3.5 bandını yakaladı; Qwen2.5 ve Gemma aynı mantığı yaygınlaştırdı ve sorgu başına maliyet ile enerji hesabı, kurumu geniş görevler dışındaki her yerde fine-tune edilmiş küçük modele yöneltti.

Ders kitabı verisi ham güce karşı

Microsoft’un Aralık 2023 bildirimi “Textbooks Are All You Need” başlığını taşıyordu: 1,3 milyar parametreli Phi-1, sentetik ders kitabı kalitesinde metinler ve seçilmiş alıştırmalarla eğitildi; HumanEval’de %50,6 pass@1 elde edildi ve eğitim 8 A100 üzerinde dört gün sürdü.

O dönemin standart hesabında 1,3B sınıfı modeller kod kıyaslamalarının dibindeydi. Phi-1, parametre açığının önemli bölümünün veri kalitesiyle kapatılabileceğini gösterdi ve küçük model kampı için adeta manifestoya dönüştü.

Küçük sınıf olgunlaşıyor

Phi-3-mini 3,8 milyar parametreyle MMLU’da %69’a çıktı ve GPT-3.5 seviyesini hedefledi. Gemma, 2B ve 7B’lik iki metin modeliyle on sekiz metin görevinin on birinde aynı sınıftaki açık modelleri geride bıraktı. Qwen2.5 ise 0,5B’den 720B’ye uzanan seride 18 trilyon tokenlik eğitimle 7B ve 14B üyelerini sınıfının en iyilerinden yaptı.

Üç çizginin ortak noktası damıtma, sentetik veri ve sıkı eleme. Bu kombinasyon, ölçek eşittir akıl varsayımının istisnalarını laboratuvar sonucu olmaktan çıkarıp üretim seçeneğine dönüştürdü.

Maliyet ve enerji eğrisi

Dev modelin tek sorgusu, küçük modelinkinden parametre ve önbellek oranında pahalı; aynı görev sıkıştırılmış bir modelle giriş seviyesi hızlandırıcıda ya da işlemcide çalışabiliyor. Model kartlarındaki ölçümler, küçük ve sıkıştırılmış modellerde enerji farkının katlandığını gösteriyor; BitNet’in işlemcide ölçülen 0,028 jul’luk adım maliyeti bunun uç örneği.

Kurumsal tarafta hesap tanıdık: dar bir alan için tek seferlik fine-tune edilmiş 7–8B sınıfı model ve ucuz yerel çıkarım; geniş görevler için dev API. DeepSeek-R1’in güçlüden zayıfa damıtma varyantlarını yayımlaması, yarışma matematiğinin küçük sınıfa sığabildiğine dair en dikkat çekici kanıtlardan biri oldu.

Nerede yeniliyor?

Küçük modellerin kaybettiği yer, tanım gereği öngörülemez olan yer: uzun çok adımlı görevler, araç kullanımı, nadir dünya bilgisi ve talimatlara sıkı uyum. Buralarda doğruluk test zamanı hesap satın alınarak geri kazanılabiliyor, ama sorgu başına bütçe kabarıyor.

Acı ders argümanı da bunu söylüyor: ham güç ve veri uzun vadede kaliteyi yener. Phi’nin mirasçısı akıllı veri yaklaşımı ise aynı yasayı farklı eksenden zorluyor. Tartışma bitmedi; yanıt, görevin dar ya da geniş olmasına göre ayrışıyor.

Eğrinin yönü

Gelecek büyük olasılıkla ikili bir mimari: cihazda ya da kurum içinde alanına fine-tune edilmiş küçük uzman; geniş ve belirsiz işler için bulutta dev genel model. İki katman arasındaki yönlendirme kararı, ürünlerin sessiz ama kritik tasarım düğmesi hâline geliyor.

Llama’nın ücretsiz ağırlık hamlesi ve Qwen’in sessiz yükselişi bu eğrinin altyapısını kurdu. Artık soru “küçük model yeter mi?” değil; “hangi görevde, hangi doğrulukta ve hangi birim maliyetle?”

  • Veri kalitesi, parametre açığını dar alanlarda kapatabiliyor
  • Damıtma, öğretmen modelin davranışını küçük sınıfa taşıyor
  • Sorgu başına maliyet ve enerji küçük modeli kurumsal yapıyor
  • Uzun ve belirsiz görevlerde dev modeller referans olmaya devam ediyor
  • Sonuç hibrit: yerel küçük uzman, bulutta dev genel akıl

Sık sorulan sorular

Küçük modeller büyükleri gerçekten geçiyor mu?

Dar ve iyi tanımlı alanlarda evet: Phi-1 sınıfının çok üstündeki kod modellerini HumanEval’de geçti, Qwen2.5’ın 7B ve 14B üyeleri akranlarını geride bıraktı. Açık uçlu, geniş görevlerde ise dev modeller hâlâ önde ve test zamanı hesapla fark daha da açılıyor.

Neden “akıllı veri” bu kadar etkili?

Seçilmiş ve sentetik olarak zenginleştirilmiş veri, modelin öğrenmesi gereken gürültüyü azaltıyor; aynı parametre bütçesi daha verimli harcanıyor. Bu, “her şeyi yut, ölçek büyüsün” yaklaşımına bilinçli bir alternatif ve eğitim maliyetini kat kat düşürüyor.

Şirketler neden küçük modele dönüyor?

Maliyet, gecikme, veri sahipliği ve davranış tutarlılığı: tek bir alana fine-tune edilmiş 7–8B sınıfı model dev API’den ucuz, veriyi dışarı çıkarmıyor ve çıktısı daha öngörülebilir. Damıtma varyantlarının yaygınlaşması bu dönüşümü hızlandırdı.

Bu “acı ders”i çürütüyor mu?

Tam olarak hayır; tartışma ötelenmiş durumda. Uzun vadede ölçek ve veri kazanıyor, ama ürünlerin çoğu geniş bir dağılım yerine dar görevlerden geliyor. Dar alanda veri mühendisliği ölçekten önce davranabildiği için tablo ikiye bölünüyor.

Kaynakça

  1. Textbooks Are All You NeedarXiv
  2. Phi-3 Technical Report: A Highly Capable 3.8B Language ModelarXiv
  3. Gemma: Open Models Based on Gemini Research and TechnologyarXiv
  4. Qwen2.5 Technical ReportarXiv
  5. DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement LearningarXiv

Bu konuyla ilgili haberler