Test-Time Ölçekleme: Doğruluğu Çıkarım Hesabıyla Satın Almak

552 kelime3 dk okuma

Test-time yani çıkarım anı ölçeklemesi, bir soru yanıtlanırken harcanan hesap ve üretilen düşünce tokenı miktarını artırarak doğruluğu iyileştirme yaklaşımıdır; OpenAI’ın Eylül 2024’te tanıttığı o1 bunu pekiştirmeli öğrenmeyle eğitilmiş uzun zincirlere taşıdı, Ağustos 2024 tarihli ölçek çalışması ise eşit çıkarım bütçesinde optimal dağıtımın küçük modelleri devasa akranlarının önüne geçirebildiğini gösterdi.

o1 anı neyi değiştirdi?

OpenAI 12 Eylül 2024’te o1-preview ve o1-mini’yi tanıtırken asıl iddiasını parametre sayısına değil, yanıt vermeden önce ürettiği uzun iç monoloğa bağladı. Şirket, modelin pekiştirmeli öğrenmeyle düşünce zinciri kurmayı öğrendiğini ve başarısının hem eğitim hesabı hem de çalışma anındaki hesap arttıkça yumuşak biçimde yükseldiğini bildirdi.

Bağımsız ölçüm bu tabloyu sayıya döktü. ARC Prize’ın kamuya açık değerlendirmesinde o1-preview görev başına yaklaşık 4,2 dakikalık bir bütçeyle %21,2 civarı çözerken, GPT-4o çok daha kısa süreyle %9 bandında kaldı. Yani fark, kısmen harcanan zamandı.

Hesabı nereye koyacağınız meselesi

Ağustos 2024 tarihli “Scaling LLM Test-Time Compute Optimally” çalışması, çıkarım hesabını rastgele değil probleme göre dağıtmanın verimliliği dört katın üzerinde artırabildiğini raporladı. Amaç, fazla örneklemeyi kesip zor problemlere daha fazla ardıl düzeltme ayırmak.

Aynı çalışmanın en çok alıntılanan sonucu şuydu: eşit çıkarım bütçesi altında compute-optimal bir strateji uygulayan 4 milyar parametreli bir model, kendinden on dört kat büyük bir modeli geride bırakabiliyor. Bu, ölçek yasalarının yönünü sorgulayan bir iddiaydı.

Bütçeyi elle ayarlamak

Ocak 2025’te yayımlanan s1 çizgisi, bu davranışı elde etmenin sanıldığı kadar pahalı olmadığını gösterdi. Yalnızca bin eğitim örneğiyle eğitilen model, “budget forcing” denen yöntemle yanıt kesilip devam etmesi için bir bekleme tetikleyicisi eklenerek daha uzun düşünmeye zorlanıyor.

Sonuç, düşünce tokenı bütçesinin açık bir kontrol düğmesine dönüşmesi: raporlanan karşılaştırmalarda model, matematik ve yarışma problemlerinde o1-preview’in %27’ye varan farkla önüne geçebildi. Bütçe büyüdükçe doğruluk artıyor, ama artış aynı hızda gitmiyor.

Ekonomi tarafı

Bu rejimde maliyetin ağırlığı tek seferlik eğitimden, sorgu başına ödenen çıkarıma kayıyor. Bir kullanıcı “daha doğru” cevabı, saniyeler değil dakikalar süren bir hesaplama satın alarak elde ediyor; fiyatlandırma ve kotalar da düşünce bütçesi etrafında kurulmaya başlıyor.

Bu kayma altyapı tartışmasını da besliyor: daha az ama daha uzun süren istekler eşzamanlılık planlamasını ve veri merkezi enerji bütçesini etkiliyor. İlk yanıt gecikmesi ile toplam tamamlanma süresi arasındaki ayrım ürün tasarımının merkezine oturdu.

Yasa mı, pazarlama mı?

Düşünce zincirinin neden işe yaradığını anlatan komşu maddenin yanında buradaki iddia başka: ölçeklenebilir bir alışveriş. Doğruluk, hesap karşılığında satın alınabilen bir değişken gibi davranıyor ve marjinal kazanç sonunda düzleşiyor.

Sınır ise doğrulama. Doğru cevabın kolayca ölçülebildiği görevlerde ekstra hesap gerçek fayda üretiyor; açık uçlu, öznel görevlerde daha uzun monolog daha güvenilir bir metin anlamına gelmiyor, hatta gereksiz uzunluk ve yeni hata riski ekliyor.

  • Doğruluk, çıkarım anında harcanan hesapla birlikte artıyor
  • Hesabı probleme göre dağıtmak verimliliği 4 katın üzerine çıkarabiliyor
  • Optimal dağıtımla 4B model 14 kat büyüğünü geçebiliyor
  • Düşünce tokenı bütçesi elle ayarlanabilir bir düğmeye dönüştü
  • Maliyet eğitimden sorgu başına ödemeye kaydı

Sık sorulan sorular

Test-time scaling ne demek?

Model eğitildikten sonra, tek bir soruyu çözerken harcanan hesabı artırmak demek. Daha fazla düşünce tokenı üretmek, birden çok aday çözüm örneklamek veya adayları ardıl düzeltmelerle iyileştirmek bu kapsamda sayılır; hedef doğruluğu satın almaktır.

Düşünce zincirinden farkı nedir?

Düşünce zinciri tekniği ara adımlar yazmanın neden işe yaradığını açıklar. Test-time ölçekleme ise bunun ölçekte nasıl davrandığını sorar: bütçe arttıkça kazanç nasıl değişir, hesap eğitime mi çıkarıma mı ayrılmalı, hangi görevde marjinal getiri düşer.

Her görevde işe yarar mı?

Hayır. Kazanç, doğru cevabın otomatik denetlenebildiği matematik ve kod görevlerinde belirgin. Açık uçlu ve öznel görevlerde daha fazla hesap daha güvenilir bir çıktı garanti etmez; bunun yerine gereksiz uzunluk ve yeni hata riski doğabilir.

Fiyatları nasıl etkiledi?

Maliyet ağırlığı tek seferlik eğitimden sorgu başına çıkarıma kaydığı için, kullanıcı tarafında düşünce bütçesi seçimi bir fiyatlandırma kararına dönüştü. Uzun süren istekler ayrıca eşzamanlılık planlamasını ve veri merkezi enerji bütçesini etkiliyor.

Kaynakça

  1. Learning to reason with LLMs (o1)OpenAI
  2. OpenAI o1 Results on ARC-AGI-PubARC Prize
  3. Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model ParametersarXiv
  4. s1: Simple test-time scalingarXiv

Bu konuyla ilgili haberler