Bir yapay zekâ inceleyicisi onlarca yorum bırakıp yine de sürüm açısından önemli bir hatayı gözden kaçırabilir. GitHub, 5 Ekim 2026’da ajanları bulunan sorunlara, kaçırdıklarına ve yorumlarının doğruluğuna göre karşılaştıran bir kıyaslama aracının araştırma önizlemesi olan ReviewBench’i tanıttı.
Geliştiriciler açısından burada önemli olan, yorumları saymaktan içeriklerini değerlendirmeye geçiş. Kıyaslama aracı, ajanın çıktısını pull request için hazırlanmış sorunların referans kümesiyle karşılaştırıyor; bulguların ciddiyetini ve kategorisini de ayrıca hesaba katıyor.
ReviewBench tam olarak neyi ölçüyor?
Veri kümesinde açık lisanslı 187 depodan, 19 dilde yazılmış 219 herkese açık pull request yer alıyor. GitHub, külliyatı oluştururken 103,9 milyondan fazla PR’ın dağılımını incelediğini bildiriyor. Depo ve dil büyüklükleri, GitHub’daki genel dağılım göz önünde bulundurularak seçildi; incelemeye daha elverişli ve daha kapsamlı PR’lara yer vermek için değişikliklerin boyutu bilinçli olarak daha büyük PR’lar lehine kaydırıldı.
Her PR için kıyaslama aracı, ciddiyet ve kategori etiketleri taşıyan referans yorumları saklıyor. Kategorilere doğruluk, güvenlik, güvenilirlik, bakım kolaylığı ve test örnek verilebilir. ReviewBench, doğruluğu (ajan yorumlarının ne kadarının gerçek sorunlarla örtüştüğünü) ve kapsamı (bilinen sorunların ne kadarının ajan tarafından bulunduğunu) hesaplıyor. Fβ ölçütü, bu iki kriterin göreli ağırlığını değiştirmeye olanak tanıyor: daha fazla sorun bulmak için kapsam ağırlığı; gürültülü yorumları azaltmak içinse doğruluk ağırlığı artırılabiliyor.
GitHub’ın rakamları nasıl okunmalı?
Yayında, ReviewBench etiketleriyle kıdemli mühendislerin bağımsız yeniden değerlendirmesi arasında %96,6 uyum olduğu belirtiliyor. Bu, referans bulgulara ilişkin uzman değerlendirmelerinin tutarlılığını gösteriyor; herhangi bir yapay zekâ ajanının doğruluğunu değil.
GitHub ayrıca Copilot kod incelemesi için bir model topluluğuyla gerçekleştirdiği kurum içi A/B testini anlattı. Şirketin verilerine göre kontrol grubuna kıyasla, ilgili kod değişiklikleriyle sonuçlanan yorumların oranı %8,0, kapsam %13,6 ve yorum hacmi %61 arttı; inceleme maliyeti ise %8,0 azaldı. Bunlar GitHub’ın tek bir deneyinden elde edilen sonuçlar; tüm ajanların değerlendirmesi ya da diğer ekiplerde aynı etkinin görüleceğine dair bir vaat değil.
Metriklerin ayrı ayrı ele alınması, özellikle ekip inceleme ayarlarını seçerken işe yarıyor. Yorum hacmindeki artış, yararlı bulguların artışıyla birlikte görülebilir; ancak tek başına bunların kaçının doğrulandığını göstermez. ReviewBench sonuçları ciddiyete ve kategorilere göre de ayırıyor; böylece ekip, örneğin kritik hatalara veya güvenlik sorunlarına ayrı ayrı bakabiliyor.
Kıyaslama aracı nasıl denenir?
GitHub’ın açıklamasına göre araştırma önizlemesi, veri kümesinin tamamını incelemeye, yayımlanmış sonuçları karşılaştırmaya ve kendi ajanınızı çalıştırmaya olanak tanıyor. Ön deneme için 25 PR; tam çalışma içinse üç turda 219 PR bulunuyor. Katılımcı bir konteyner imajı, yapılandırma ve kendi model anahtarını sağlıyor; değerlendirme ortak bir hakemle yürütülüyor. Gönderim sonuçları incelenip onaylanana kadar gizli tutuluyor.
Böyle bir denemenin pratik amacı, karşılaştırılabilir bir başlangıç noktası elde etmek ve ardından sistemi ekibin kendi inceleme kuralları ile depoya özgü değişiklikler üzerinde sınamak. Belirli bir ekibin koşulları—kullandığı diller, mimari, ciddiyet eşikleri ve kabul edilebilir gürültü düzeyi—genel veri kümesinin kapsamından farklı olabilir.
GitHub, deneylerinde ReviewBench çevrimdışı değerlendirmelerindeki değişimlerin, canlı kullanım sonuçlarıyla aynı yönde örtüştüğünü belirtiyor. Yayımlanan ölçümler şirketin kendi testlerine ait. Bu nedenle kıyaslama aracının bugün en güvenilir kullanımı, ajanları ortak bir veri kümesinde karşılaştırmak ve güçlü oldukları yönleri belirlemek. Sistemi devreye alma kararı ise belirli ekibin iş akışında yapılacak denemelere de dayanmalı.