Breaking News · Novinky
GitHub představila ReviewBench: AI recenzenty budou porovnávat podle nalezených chyb
GitHub 5. října představila ReviewBench, výzkumnou předběžnou verzi benchmarku pro agenty kontrolující kód. Jeho metriky rozlišují nalezené problémy, přehlédnuté chyby a zbytečný šum. Výsledky interního A/B testu společnosti popisují jeden konkrétní experiment, nikoli obecný žebříček modelů.
0
↗