jsonscraper

GitHub ReviewBench’i Açtı: Yapay Zekâ Kod İnceleyicileri Buldukları Hatalara Göre Karşılaştırılacak

Kıyaslama aracı, pull request’lerdeki bulguların kapsamını ve doğruluğunu ölçüyor; veri kümesi 19 dilde 219 herkese açık PR içeriyor.

Bir yapay zekâ inceleyicisi onlarca yorum bırakıp yine de sürüm açısından önemli bir hatayı gözden kaçırabilir. GitHub, 5 Ekim 2026’da ajanları bulunan sorunlara, kaçırdıklarına ve yorumlarının doğruluğuna göre karşılaştıran bir kıyaslama aracının araştırma önizlemesi olan ReviewBench’i tanıttı.

MacBook Pro ile kod yazan kişi
Danial Igdery · Unsplash Lisansı

Geliştiriciler açısından burada önemli olan, yorumları saymaktan içeriklerini değerlendirmeye geçiş. Kıyaslama aracı, ajanın çıktısını pull request için hazırlanmış sorunların referans kümesiyle karşılaştırıyor; bulguların ciddiyetini ve kategorisini de ayrıca hesaba katıyor.

ReviewBench tam olarak neyi ölçüyor?

Veri kümesinde açık lisanslı 187 depodan, 19 dilde yazılmış 219 herkese açık pull request yer alıyor. GitHub, külliyatı oluştururken 103,9 milyondan fazla PR’ın dağılımını incelediğini bildiriyor. Depo ve dil büyüklükleri, GitHub’daki genel dağılım göz önünde bulundurularak seçildi; incelemeye daha elverişli ve daha kapsamlı PR’lara yer vermek için değişikliklerin boyutu bilinçli olarak daha büyük PR’lar lehine kaydırıldı.

Her PR için kıyaslama aracı, ciddiyet ve kategori etiketleri taşıyan referans yorumları saklıyor. Kategorilere doğruluk, güvenlik, güvenilirlik, bakım kolaylığı ve test örnek verilebilir. ReviewBench, doğruluğu (ajan yorumlarının ne kadarının gerçek sorunlarla örtüştüğünü) ve kapsamı (bilinen sorunların ne kadarının ajan tarafından bulunduğunu) hesaplıyor. Fβ ölçütü, bu iki kriterin göreli ağırlığını değiştirmeye olanak tanıyor: daha fazla sorun bulmak için kapsam ağırlığı; gürültülü yorumları azaltmak içinse doğruluk ağırlığı artırılabiliyor.

GitHub’ın rakamları nasıl okunmalı?

Yayında, ReviewBench etiketleriyle kıdemli mühendislerin bağımsız yeniden değerlendirmesi arasında %96,6 uyum olduğu belirtiliyor. Bu, referans bulgulara ilişkin uzman değerlendirmelerinin tutarlılığını gösteriyor; herhangi bir yapay zekâ ajanının doğruluğunu değil.

GitHub ayrıca Copilot kod incelemesi için bir model topluluğuyla gerçekleştirdiği kurum içi A/B testini anlattı. Şirketin verilerine göre kontrol grubuna kıyasla, ilgili kod değişiklikleriyle sonuçlanan yorumların oranı %8,0, kapsam %13,6 ve yorum hacmi %61 arttı; inceleme maliyeti ise %8,0 azaldı. Bunlar GitHub’ın tek bir deneyinden elde edilen sonuçlar; tüm ajanların değerlendirmesi ya da diğer ekiplerde aynı etkinin görüleceğine dair bir vaat değil.

Dizüstü bilgisayar ekranında yazı yazan kişi
Giorgio Tomassetti · Unsplash Lisansı

Metriklerin ayrı ayrı ele alınması, özellikle ekip inceleme ayarlarını seçerken işe yarıyor. Yorum hacmindeki artış, yararlı bulguların artışıyla birlikte görülebilir; ancak tek başına bunların kaçının doğrulandığını göstermez. ReviewBench sonuçları ciddiyete ve kategorilere göre de ayırıyor; böylece ekip, örneğin kritik hatalara veya güvenlik sorunlarına ayrı ayrı bakabiliyor.

Kıyaslama aracı nasıl denenir?

GitHub’ın açıklamasına göre araştırma önizlemesi, veri kümesinin tamamını incelemeye, yayımlanmış sonuçları karşılaştırmaya ve kendi ajanınızı çalıştırmaya olanak tanıyor. Ön deneme için 25 PR; tam çalışma içinse üç turda 219 PR bulunuyor. Katılımcı bir konteyner imajı, yapılandırma ve kendi model anahtarını sağlıyor; değerlendirme ortak bir hakemle yürütülüyor. Gönderim sonuçları incelenip onaylanana kadar gizli tutuluyor.

Böyle bir denemenin pratik amacı, karşılaştırılabilir bir başlangıç noktası elde etmek ve ardından sistemi ekibin kendi inceleme kuralları ile depoya özgü değişiklikler üzerinde sınamak. Belirli bir ekibin koşulları—kullandığı diller, mimari, ciddiyet eşikleri ve kabul edilebilir gürültü düzeyi—genel veri kümesinin kapsamından farklı olabilir.

GitHub, deneylerinde ReviewBench çevrimdışı değerlendirmelerindeki değişimlerin, canlı kullanım sonuçlarıyla aynı yönde örtüştüğünü belirtiyor. Yayımlanan ölçümler şirketin kendi testlerine ait. Bu nedenle kıyaslama aracının bugün en güvenilir kullanımı, ajanları ortak bir veri kümesinde karşılaştırmak ve güçlü oldukları yönleri belirlemek. Sistemi devreye alma kararı ise belirli ekibin iş akışında yapılacak denemelere de dayanmalı.

People

No people listed for this article yet.

Keep readingGPT-Rosalind: ücretlendirme başlıyor, ancak API herkese açık değil
Read the next article

İlgili yazılar

Okuduklarınızı çalışan bir entegrasyona dönüştürün

jsonscraper sosyal veri API'lerini keşfedin, istekleri test edin ve sonraki iş akışınızı oluşturun.

API'leri Keşfet