Seçici Şablon, Düşünme Modu ve Geri Çekilen Güven

482 kelime3 dk okuma

Llama 4 lansmanında paylaşılan skorların her teste göre seçilmiş prompt şablonları ve açılıp kapatılan reasoning moduyla şişirildiği iddiası Nisan 2025’te büyüdü; Meta yöneticisi bunun deney olduğunu söyleyip manipülasyonu reddetti, fakat Yann LeCun 2026 başında sonuçların “biraz kaydırıldığını” söyledi.

Lansmanda ne vardı

Meta, 5 Nisan 2025’te Llama 4 ailesini duyurdu: Scout ve Maverick. Her iki model de karışık uzman mimarisiyle 17 milyar aktif parametre taşıyor, toplam boyut sırasıyla 109 ve 400 milyar seviyesinde.

Tanıtım slaytları rakipleri geride bırakan skorlar ve on milyon token’lık bağlam vaadiyle doluydu. Behemoth ise en güçlü halka olarak sadece gösterildi; çıkışı sonraya bırakıldı. Aşırı iddialı bir tablo, ince bir buz üstünde duruyordu.

İtirazın teknik çekirdeği

Topluluk, yayınlanan tabloların her benchmark için ayrı prompt şablonu ve ayrı ayarla üretildiğini savundu. Aynı modelin bir testte düşünme modu açıkken diğerinde kapalı olması, karşılaştırmayı elma ile armut yaptı.

İkinci katman daha sancılıydı: LMArena sıralamalarına sürüm dışı, sohbete optimize edilmiş bir Llama 4 deneyinin girdiği tespit edildi. Arena tarafı, bu stil uyumunun şeffaf açıklanmadığını açıkça eleştirdi.

Suçlama ve ret

Gary Marcus, Nisan 2025’te yazdığında olay bir Reddit sızıntısı olmaktan çıkmıştı; “seçici şablon” ve açılıp kapatılan akıl yürütme modu bir kampanya anlatısına dönüştü. Eleştirinin tonu, teknik olmaktan çok niyet sorgusuna kaydı.

Meta cephesi 7 Nisan 2025’te suçlamayı reddetti; yöneticiler bunun bir deney olduğunu, skoru yapay biçimde şişirmediğini söyledi. Model ağırlıkları yayımlanmaya devam etti, ama düzeltilmiş tek bir tablo gelmedi.

Güven krizinin tanıkları

Zaman çizelgesi Meta’nın lehine okunmuyor. Joëlle Pineau, 1 Nisan 2025’te yapay zekâ araştırma liderliğini bırakırken GenAI örgütlenmesine dair rahatsızlığına işaret etti. Tartışmanın tam öncesindeki bu ayrılık, iç huzursuzluğun işareti sayıldı.

Asıl itiraf 2026 başında geldi: Yann LeCun, Meta’dan ayrıldıktan sonra Llama 4 sonuçlarının “biraz kaydırıldığını” söyledi. 2026 baharında The New York Times, şirketin bir sonraki modelinin performans kaygısıyla ertelendiğini yazdı.

Açık kaynak pazarlaması için anlamı

Meta’nın açık kaynak konumu, teknik bir tercih değil güven sözleşmesiydi: ağırlıkları verin, kendiniz ölçün, biz size karışmayalım. Ölçüm sunumunun kendisi pazarlama malzemesine dönüşünce bu sözleşmenin bir ayağı boşluğa düşüyor.

Sonuç, modelin kötü olduğuna dair kanıt değil; kurumun iddia üretme hızının doğrulama hızını aştığına dair bir kayıt. Kurumsal raporlama yerine topluluk ölçümüne güvenen bir ekosistemde, şeffaf protokol eksikliği doğrudan değer kaybettirir.

  • 5 Nisan 2025: Scout ve Maverick, iddalı skor tabloları
  • Suçlama: test başına seçili şablon ve aç/kapat reasoning
  • Arena’ya yayınlanmayan sohbete optimize varyant girişi
  • 7 Nisan 2025: Meta yöneticisi manipülasyonu reddetti
  • LeCun 2026: “sonuçlar biraz kaydırıldı”

Sık sorulan sorular

Meta tam olarak neyle suçlandı?

Llama 4 tablolarında her benchmark için ayrı ve lehine seçilmiş prompt şablonları kullanıldığı, reasoning modunun testler arasında açıp kapatıldığı iddia edildi. Üstüne LMArena’ya sürüm dışı, sohbete optimize bir deneyin şeffaflık açıklanmadan sokulduğu eleştirisi eklendi.

Meta nasıl yanıt verdi?

Nisan 2025’te bir Meta yöneticisi skorların yapay biçimde şişirildiği suçlamasını reddetti ve uygulamayı deney olarak nitelendirdi. Yayımlanmış sonuç tablolarında kamuya açık bir düzeltme gelmedi.

Skor gerçekten şişirilmiş miydi?

Bağımsız bir kanıt yok; ancak 2026 başında Yann LeCun sonuçların “biraz kaydırıldığını” söyleyerek şirket içi bir doğrulama kattı. Joëlle Pineau’nun nisan 2025 ayrılığı da iç huzursuzluk işareti olarak okundu.

Neden sadece bir pazarlama sorunu değil?

Açık kaynağın değeri, topluluğun modeli kendi ölçümünde bağımsız test edebilmesi. Ölçüm protokolü şeffaf olmadığında bu denetim mekanizması çalışmaz ve kurumun “açık kaynak şampiyonu” konumu aşınır.

Kaynakça

  1. The Llama 4 herd: The beginning of a new era of natively multimodal AIMeta AI
  2. Llama 4 model kartıGitHub / meta-llama
  3. Deep Learning, Deep ScandalMarcus on AI
  4. Meta exec denies the company artificially boosted Llama 4’s benchmark scoresTechCrunch
  5. Meta’s Llama 4 herd controversy and AI contamination explainedZDNET

Bu konuyla ilgili haberler