Breaking News · Nieuws
GitHub opent ReviewBench: AI-reviewers worden vergeleken op gevonden fouten
Op 5 oktober introduceerde GitHub ReviewBench, een onderzoekspreview van een benchmark voor agents die code controleren. De meetwaarden maken onderscheid tussen gevonden problemen, gemiste problemen en overbodige ruis. De resultaten van een interne A/B-test van het bedrijf beschrijven een afzonderlijk experiment, geen algemene ranglijst van modellen.