SWE-bench: Kod Ajanlarının Standart Sınavı Nasıl Oyunlaştırıldı?

547 kelime3 dk okuma

SWE-bench, gerçek depolardan seçilmiş issue–PR çiftlerini başarısız-test-geçirme kuralıyla denetleyerek ajanların yama gücünü ölçüyor; ilk yıl %2 civarında olan çözme oranı iskelet mühendisliğiyle %60’ın üzerine çıktı, sonra saptanan çözüm sızıntısı ve ezber, OpenAI’ı 2026 başında bu sınavı terk etmeye ve doğruluğun DeepSWE gibi kirlenmemiş alanlara taşınmasına yol açtı.

Sınav nasıl kuruldu?

SWE-bench, Python depolarındaki gerçek kullanıcı issue’larını, o sorunu kapatan ve merge edilmiş pull request yamalarıyla eşleştirerek kuruldu: toplam 2.294 görev, 12 depo. Ajan yamasını ürettikten sonra değerlendirme altın yamaya benzemeyi değil, önceden başarısız olan testlerin geçmesini ölçüyor.

Princeton ekibinin Ekim 2023 bildiriminde dönemin en iyi modeli görevlerin yalnızca %1,96’sını çözebilmişti. İki yıl içinde tablo tersine döndü ve lider liste %60’ın üzerine taşındı; sınavın kaderini de tam bu uçurum belirledi.

Puan modeli değil, sistemi ölçüyor

Anthropic’in Ocak 2025 mühendislik yazısı ayırt edici veriyi koydu: Claude 3.5 Sonnet çıplak çağrıda görevlerin yaklaşık %12’sini çözerken, Bash ve dosya düzenleme araçlarıyla donatılmış minimal bir ajan SWE-bench Verified’de %49’a çıktı. Yani skor tek başına modeli değil, ajan sisteminin tamamını ölçüyor.

Bu doğa, lider tabloyu iskelet mühendisliğinin arenasına çevirdi: araç setleri, bağlam hileleri ve geri sarma kancaları puanları iteledi; sınavın gerçek yazılım işini ne kadar temsil ettiği sorgulanmaya başladı.

Verified ve sızıntı vakası

Ağustos 2024’te OpenAI ve SWE-bench yazarları ham seti insan denetiminden geçirdi: belirsiz tarifler ve hatalı testler elendi, geriye 500 doğrulanmış görev kaldı; bağımsız değerlendirmeler bunların 484’ünü kullanıyor. Amaç, skor gürültüsünü kesmekti.

Sonbahar 2024’te “solution leakage” kaydı dolaşıma girdi: kimi modellerin eğitim verisi, kesim tarihinden sonra birleşen PR’ların altın yamalarını içeriyordu. Sonraki bağımsız denetimler görevlerin üçte birine yakınında sızıntı, benzer oranda zayıf test buldu; lider tablo artık temiz bir ölçüm olarak okunmuyordu.

DeepSWE’ye taşınan doğruluk

Şubat 2026’da OpenAI, sınır modellerini SWE-bench Verified üzerinde değerlendirmeyi bıraktığını duyurdu; gerekçe çözüm değil ezberdi. Aynı dönemde SWE-bench Pro da çatlak verdi: DeepSWE denetimi %8 yanlış pozitif ve %24 yanlış negatif raporladı.

Yanıt, sınavı yeniden kurmak oldu. DataCurve’un Mayıs 2026’daki DeepSWE’si, kamuya açık olmayan 91 depodan üretilen 113 taze görevle kirlenme riskini yapısal olarak kapattı; en üst skor GPT-5.5 ile %70 civarında kaldı. Doğruluk taşındı, ama bitmedi.

Neden kritik bir eşik?

SWE-bench, kod ajanlarının ticari para birimini yarattı: ürün lansmanları, yatırım notları ve yazılım mühendisi iddiaları tek bir sayı etrafında dönüyor. Tek sayıya bağlanan her pazar gibi, oyunlaştırma baskısıyla çatladı.

Vaka aynı zamanda yöntem dersi üretti: değerlendirmeler artık yalnızca yeteneği değil, ölçümün kendi sağlamlığını da raporlamak zorunda. Kirlenme denetimi, insan doğrulaması ve kapalı görev havuzları benchmark duyurularının standart bölümleri hâline geldi.

  • Gerçek issue–PR çiftleri, birim testlerle otomatik denetleniyor
  • Çözme oranı iki yılda %2’den %60’ın üzerine çıktı
  • Skor, modeli değil iskeletiyle birlikte ajan sistemini ölçüyor
  • Sızıntı ve ezber, OpenAI’ı 2026’da sınavı terk ettirdi
  • Doğruluk DeepSWE gibi kapalı, kirlenmemiş görev havuzlarına taşındı

Sık sorulan sorular

SWE-bench tam olarak neyi ölçüyor?

Gerçek bir depodan alınmış issue ve ona karşılık gelen görev. Model ya da ajan ürettiği yamayı uygular; önceden başarısız olan testler geçiyorsa görev çözülmüş sayılır. Ölçülen, yamanın davranışıdır, altın yamaya benzemesi değil.

Neden SWE-bench Verified’e geçildi?

Çünkü ham setin bir bölümü çözülemez ya da hatalı testlere sahipti. OpenAI ve SWE-bench yazarları 2024’te 500 görevi insan onayından geçirdi; gürültü azaldı ve karşılaştırılabilirlik arttı. Sonradan ezberleme bulguları bu subseti de tüketme noktasına getirdi.

“Solution leakage” nedir?

Bir modelin eğitim verisi, kesim tarihinden sonra birleşen PR’ları ve dolayısıyla altın yamaları içeriyorsa sınav ezberden çözülür. 2024 sonundan itibaren art arda denetimler bu sızıntının boyutunu ve yaygın zayıf testleri belgeledi; puanlar gerçek yeteneği temsil etmemeye başladı.

Benchmark tamamen mi değersizleşti?

Hayır; lider tablo artık sınırlı güvenle okunan bir karşılaştırma aracına dönüştü. Değer üretimi sürüyor: DeepSWE gibi kirlenmemiş havuzlar, daha uzun ve gerçekçi görevler ile otomatik denetim katmanları kuruluyor. Sınav ölmedi, ölçüm yeri değişti.

Kaynakça

  1. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?arXiv
  2. Introducing SWE-bench VerifiedOpenAI
  3. SWE-bench VerifiedSWE-bench
  4. Why we no longer evaluate SWE-bench VerifiedOpenAI
  5. Claude SWE-Bench PerformanceAnthropic
  6. DeepSWE: Measuring frontier coding agentsDataCurve
  7. SWE-bench: What It MeasuresPrompt20 Blog

Bu konuyla ilgili haberler