Breaking News · Aktualności
GitHub udostępnia ReviewBench: agentów AI do przeglądu kodu porówna liczba wykrytych błędów
5 października GitHub zaprezentował ReviewBench — zapowiedź badawczą benchmarku dla agentów sprawdzających kod. Zastosowane metryki rozdzielają wykryte problemy, pominięcia i zbędny szum, a wyniki wewnętrznego testu A/B firmy opisują pojedynczy eksperyment, a nie ogólny ranking modeli.
0
↗