AI recenzent může zanechat desítky komentářů, a přesto přehlédnout chybu důležitou pro vydání. GitHub 5. října 2026 představila ReviewBench — výzkumnou předběžnou verzi benchmarku, který porovnává agenty podle nalezených problémů, přehlédnutých chyb a přesnosti připomínek.
Pro vývojáře je důležitý posun od počítání komentářů k ověřování jejich obsahu. Benchmark porovnává výstup agenta s referenčním souborem problémů pro pull request a samostatně zohledňuje závažnost a kategorii nálezů.
Co přesně ReviewBench hodnotí
Soubor obsahuje 219 veřejných pull requestů ze 187 repozitářů s otevřenou licencí a kódem v 19 jazycích. GitHub uvádí, že při sestavování korpusu analyzovala rozložení více než 103,9 milionu PR. Velikost repozitářů a zastoupení jazyků vybírala s ohledem na celkový vzorek GitHubu, zatímco velikost změn záměrně posunula směrem k obsahově bohatším PR vhodným k revizi.
Pro každý PR benchmark uchovává referenční připomínky označené podle závažnosti a kategorie — například správnost, bezpečnost, spolehlivost, udržovatelnost a testování. ReviewBench počítá přesnost: jaká část komentářů agenta odpovídá skutečným problémům, a úplnost: jakou část známých problémů agent odhalil. Ukazatel Fβ umožňuje změnit relativní váhu těchto dvou kritérií: vyšší váha úplnosti se hodí při hledání co největšího počtu problémů, zatímco vyšší váha přesnosti pomáhá omezit šum v připomínkách.
Jak číst čísla GitHubu
V publikaci je uvedena 96,6% shoda mezi označením v ReviewBench a nezávislou kontrolou zkušených inženýrů. Jde o ukazatel shody expertních hodnocení referenčních nálezů, nikoli o přesnost některého AI agenta.
GitHub samostatně popsala interní A/B test souboru modelů pro Copilot code review. Podle společnosti se oproti kontrolní skupině zvýšil podíl komentářů, po nichž následovaly odpovídající změny kódu, o 8,0 %, úplnost o 13,6 % a objem komentářů o 61 %, zatímco náklady na revizi klesly o 8,0 %. Jde o výsledek jednoho experimentu GitHubu; není to hodnocení všech agentů ani příslib stejného efektu v jiných týmech.
Rozdělení metrik je zvlášť užitečné při výběru nastavení revize. Velký počet připomínek může znamenat více užitečných nálezů, sám o sobě však neukazuje, kolik z nich se potvrdilo. ReviewBench také rozděluje výsledky podle závažnosti a kategorií, takže tým může samostatně sledovat například kritické chyby nebo bezpečnostní problémy.
Jak benchmark vyzkoušet
Podle popisu GitHubu umožňuje výzkumná předběžná verze prozkoumat celý soubor dat, porovnat zveřejněné výsledky a spustit vlastního agenta. Pro předběžný běh je připraveno 25 PR; úplný běh zahrnuje 219 PR ve třech kolech. Účastník dodá obraz kontejneru, konfiguraci a vlastní klíč k modelu, přičemž hodnocení probíhá se společným posuzovatelem. Výsledky zůstávají soukromé až do kontroly a schválení odeslání.
Praktickým přínosem takového běhu je získání srovnatelného výchozího bodu a následné ověření systému podle vlastních pravidel revize a změn typických pro daný repozitář. Podmínky konkrétního týmu — jazyky, architektura, prahy závažnosti a přijatelná míra šumu — se mohou od složení obecného korpusu lišit.
GitHub tvrdí, že změny v offline hodnocení ReviewBench v jejích experimentech odpovídaly stejným směrem i výsledkům v provozu. Zveřejněná měření se týkají vlastních testů společnosti. Nejspolehlivějším současným využitím benchmarku je proto porovnávání agentů na společném vzorku a diagnostika jejich silných stránek; rozhodnutí o nasazení by mělo vycházet také z ověření v pracovním procesu konkrétního týmu.