Breaking News · Neuigkeiten
GitHub stellt ReviewBench vor: KI-Reviewer werden anhand gefundener Fehler verglichen
Am 5. Oktober stellte GitHub ReviewBench vor – eine Forschungsvorschau auf einen Benchmark für Code-Review-Agenten. Seine Metriken unterscheiden gefundene Probleme, übersehene Fehler und unnötiges Rauschen. Die Ergebnisse eines internen A/B-Tests des Unternehmens beschreiben ein einzelnes Experiment und keine allgemeine Rangliste von Modellen.