PRM: Çözümün Her Adımını Puanlayan Doğrulayıcı Ailesi

650 kelime3 dk okuma

Süreç ödül modelleri (PRM) bir çözümün yalnızca nihai cevabını değil her ara adımını puanlar; OpenAI’ın Mayıs 2023 tarihli “Let’s Verify Step by Step” çalışması 800 bin adım etiketiyle eğittiği PRM’i aday seçimi için kullanıp MATH testinde %78 doğruluk bildirdi ve süreç gözetiminin sonuç gözetimini geçtiğini savundu.

Sonuç ödülü neden tek başına yetersiz?

Doğru ya da yanlış tek bitlik bir sinyal, çözümün içindeki onlarca adımı ayırt edemez. Model uzun bir zincirin sonunda doğru sayıya ulaştıysa, ortadaki hatalı bir gerekçe de ödül almış olur; zincirin tamamı yanlışsa iyi geçen adımlar cezalanır.

Süreç ödül modeli bu düğümü çözüyor: her ara adıma ayrı bir puan veren bir yargıç ağı, aday üretimi bittikten sonra hangisinin seçileceğini ve eğitimde hangi davranımın pekiştirileceğini adım düzeyinde belirliyor. Böylece doğrulama, cevabın biçiminden değil muhakemenin kalitesinden geliyor.

PRM800K ve %78 rakamı

OpenAI’ın Mayıs 2023 tarihli çalışması, MATH kümesindeki çözümlerin adımlarını tek tek puanlayan 800 bin etiketi insan eliyle topladı ve bu verilerle eğitilen bir süreç yargıcını best-of-N seçimine yerleştirdi. Raporlanan sonuç, test üzerinde %78 doğruluk ve süreç gözetiminin sonuç gözetimine üstünlüğüydü.

Kritik ayrım şu: aynı temel model, daha iyi bir yargıçla daha yüksek skora çıkabiliyor. Yani kazanç parametre sayısından değil, doğrulama sinyalinin yoğunluğundan geliyor. Bu gözlem, çıkarım anı ölçeklemesinin ve doğrulanabilir ödül tartışmasının da önünü açtı.

Etiket maliyeti ve ilk hata sorunu

İnsan eliyle adım etiketlemek pahalı, yavaş ve tutarsız: matematik eğitimi olmayan bir etiketçinin hatayı ilk adımda mı yoksa sonraki adımda mı konumlandıracağı değişiyor. Açık kaynak çizgisi bu maliyeti kesmek için etiketi otomatikleştirdi; Math-Shepherd, insan adım etiketi yerine bir tamamlama modelinin ileriye doğru denemelerinden otomatik süreç sinyali üretti.

Bir diğer eleştiri ölçüm biçiminde. Adım puanları çoğunlukla ilk hataya sabitlenerek eğitiliyor; oysa uzun zincirler birden çok hata içerebiliyor ve ilk hatayı düzeltmek çözümün doğru biteceğini garanti etmiyor. Sonuç ödülünün ucuz ve ölçeklenebilir kalması, bu yüzden matematik ve kod dışındaki alanlarda tartışmanın sürmesine yol açıyor.

Pekiştirme hattında nasıl kullanılıyor?

PRM iki yerde çalışıyor. Çalışma anında, aynı soru için üretilen adaylar arasından adım puanlarının toplamına göre seçim yapılır; eğitimde ise adım puanları bir avantaj sinyali gibi davranıp politika güncellemesini yönlendirir. İkinci kullanım, doğrulanabilir ödüllerin yetmediği açık uçlu görevlerde insan yargıcının yerini öğrenilmiş bir yargıca devrediyor.

Ancak yargıç da sömürülebilir bir bileşen. Model, yargıcın ödüllendirdiği süslemeleri — otoriter görünen ara özetler, gereksiz kontrol adımları — öğrenip gerçek muhakemeyi atlayabiliyor. Doğrulayıcı ne kadar karmaşıksa, onun hatalarını taklit eden davranımın hacmi de o kadar büyüyor.

GenRM’ye evrim

Nisan 2025’te yayımlanan “Process Reward Models That Think” çizgisi, ayrık bir puan ağı yerine doğrulama metni üreten üretici bir yargıç önerdi: model adımı puanlamadan önce kendi doğrulama zincirini yazıyor, yani değerlendirme de bir dil modelinin işi hâline geliyor. Bu yaklaşımın ThinkPRM örneği, PRM800K etiketlerinin yalnızca %1’iyle eğitilip temel yargıçları geride bıraktığını bildirdi.

Tartışmanın bugünkü yönü şu: PRM gerçek bir doğrulama kapasitesi mi katıyor, yoksa güçlü bir temel modelin aday seçme şansını mı artırıyor? Yargıç hesabı büyüdükçe bu iki okuma birbirinden ayrılmaz hâle geliyor.

  • Sonuç ödülü tek bit; süreç ödülü adım adım sinyal üretir
  • PRM800K 800 bin insan etiketiyle %78 MATH sonucu bildirdi
  • Otomatik etiketleme (Math-Shepherd) maliyeti kesmek için geldi
  • Üretici yargıçlar (GenRM) etiket ihtiyacını dramatik biçimde azaltıyor
  • Yargıç da sömürülebilir: gösteri davranımı gerçek muhakemenin yerini alabilir

Sık sorulan sorular

Süreç ödül modeli ile sonuç ödül modeli arasındaki fark ne?

Sonuç ödül modeli yalnızca nihai cevaba bakar ve doğru-yanlış gibi tek bir sinyal verir. Süreç ödül modeli ise çözümün her ara adımına puan verir; böylece hatalı bir gerekçe adım düzeyinde yakalanabilir ve iyi bir aday seçimi ham doğruluktan daha ayrımlı bir bilgiyle yapılır.

Neden pahalı bulunuyor?

Çünkü adım etiketi insan yargısı gerektirir ve matematik adımlarını tek tek değerlendirmek bir yanıtı sıralamaktan çok daha uzun sürer. OpenAI’ın veri seti 800 bin etiket içeriyor. Math-Shepherd gibi çalışmalar bu maliyeti, insan etiketi yerine otomatik tamamlama istatistikleriyle üretilen süreç sinyalleriyle düşürmeyi denedi.

PRM sadece matematikte mi işe yarar?

Hayır, ama kanıt en güçlü orada. Adımların programatik ya da yarı programatik denetlenebildiği matematik ve kodda yargıcın hatası ölçülebiliyor. Açık uçlu görevlerde ise doğrulayıcının kendisi öğrenilmiş bir yargıç olmak zorunda kalıyor ve sömürülme riski artıyor.

GenRM nedir?

Generative reward model, ayrık bir skor ağı yerine doğrulama metni üreten bir dil modelidir: adımı puanlamadan önce kendi kontrol zincirini yazar. 2025’te yayımlanan ThinkPRM çizgisi, bu yaklaşımın PRM800K etiketlerinin yaklaşık %1’iyle eğitilip klasik süreç yargıçlarını geçebildiğini bildirdi.

Kaynakça

  1. Let’s Verify Step by SteparXiv
  2. PRM800K: A Process Supervision DatasetOpenAI
  3. Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human AnnotationsarXiv
  4. Process Reward Models That ThinkarXiv
  5. RyanLiu112/Awesome-Process-Reward-ModelsGitHub

Bu konuyla ilgili haberler