jsonscraper

GitHub lanserar ReviewBench: AI-granskare ska jämföras utifrån upptäckta buggar

Benchmarken bedömer fullständigheten och precisionen i kommentarer om pull requests; datamängden omfattar 219 offentliga PR:er på 19 språk.

En AI-granskare kan lämna dussintals kommentarer och ändå missa en bugg som är viktig inför en release. Den 5 oktober 2026 presenterade GitHub ReviewBench, en forskningsförhandsversion av en benchmark som jämför agenter utifrån upptäckta problem, missar och kommentarernas precision.

Person som kodar med en MacBook Pro
Danial Igdery · Unsplash-licens

För utvecklare är det viktiga här skiftet från att räkna kommentarer till att granska deras innehåll. Benchmarken jämför agentens resultat med en referensuppsättning problem för pull requests och tar separat hänsyn till upptäckternas allvarlighetsgrad och kategori.

Vad ReviewBench utvärderar

Datamängden innehåller 219 offentliga pull requests från 187 öppet licensierade kodarkiv, med kod på 19 språk. GitHub uppger att företaget analyserade fördelningen i över 103,9 miljoner PR:er när materialet sammanställdes. Storleken på kodarkiv och språk valdes med hänsyn till GitHubs totala urval, medan ändringarnas omfattning medvetet lutade åt mer innehållsrika PR:er som lämpar sig för granskning.

För varje PR innehåller benchmarken referenskommentarer med etiketter för allvarlighetsgrad och kategori, till exempel korrekthet, säkerhet, tillförlitlighet, underhållbarhet och testning. ReviewBench mäter precision: hur stor andel av agentens kommentarer som motsvarar verkliga problem, och fullständighet: hur stor andel av de kända problemen agenten upptäckte. Måttet Fβ gör det möjligt att ändra den relativa vikten för de två kriterierna: större vikt på fullständighet passar när målet är att hitta fler problem, medan större vikt på precision kan användas för att minska brusiga kommentarer.

Så tolkar du GitHubs siffror

Publiceringen anger 96,6 procents överensstämmelse mellan ReviewBenchs märkning och en oberoende granskning utförd av seniora ingenjörer. Det är ett mått på hur väl experterna var överens om referensproblemen, inte på någon AI-agents precision.

Separat beskrev GitHub ett internt A/B-test av en ensemble av modeller för Copilot code review. Enligt företaget ökade andelen kommentarer som följdes av motsvarande kodändringar med 8,0 procent jämfört med kontrollgruppen, fullständigheten ökade med 13,6 procent, antalet kommentarer med 61 procent och kostnaden för granskning minskade med 8,0 procent. Det här är resultat från ett enda experiment hos GitHub; de utgör inte en utvärdering av alla agenter eller ett löfte om samma effekt i andra team.

Person som skriver på en datorskärm på en bärbar dator
Giorgio Tomassetti · Unsplash-licens

Att dela upp måtten är särskilt användbart när ett team väljer inställningar för kodgranskning. Ett stort antal kommentarer kan sammanfalla med fler användbara upptäckter, men i sig visar det inte hur många av dem som bekräftades. ReviewBench delar också upp resultaten efter allvarlighetsgrad och kategori, så att teamet exempelvis kan granska kritiska buggar eller säkerhetsfrågor separat.

Så testar du benchmarken

Enligt GitHubs beskrivning ger forskningsförhandsversionen möjlighet att utforska hela datamängden, jämföra publicerade resultat och köra en egen agent. En preliminär körning omfattar 25 PR:er; en fullständig körning omfattar 219 PR:er i tre omgångar. Deltagaren tillhandahåller en containeravbildning, en konfiguration och en egen modellnyckel, och utvärderingen genomförs med en gemensam domare. Resultaten förblir privata tills bidraget har granskats och godkänts.

Den praktiska poängen med en sådan körning är att få en jämförbar utgångspunkt och sedan testa systemet mot de egna granskningsreglerna och de ändringar som är typiska för kodarkivet. Ett enskilt teams förutsättningar – språk, arkitektur, allvarlighetsgränser och acceptabel nivå av brus – kan skilja sig från sammansättningen i den allmänna datamängden.

GitHub hävdar att förändringar i ReviewBenchs offlineutvärderingar i företagets experiment stämde överens med resultaten i produktion. De publicerade mätvärdena gäller företagets egna tester. Därför är benchmarkens mest tillförlitliga användning i nuläget att jämföra agenter på ett gemensamt urval och undersöka deras styrkor. Beslut om införande bör även bygga på tester i det egna teamets arbetsflöde.

People

No people listed for this article yet.

Keep readingGPT-Rosalind: prissättningen börjar gälla, men API:t är inte öppet för alla
Read the next article

Relaterade artiklar

Gör det du läser till en fungerande integration

Utforska jsonscrapers API:er för social data, testa anrop och bygg nästa arbetsflöde.

Utforska API:er