Ein KI-Reviewer kann Dutzende Kommentare hinterlassen und trotzdem einen Fehler übersehen, der für eine Veröffentlichung wichtig ist. Am 5. Oktober 2026 stellte GitHub ReviewBench vor – eine Forschungsvorschau auf einen Benchmark, der Agenten anhand gefundener Probleme, übersehener Fehler und der Genauigkeit ihrer Kommentare vergleicht.
Für Entwickler ist hier der Wechsel vom Zählen der Kommentare hin zur Prüfung ihres Inhalts entscheidend. Der Benchmark vergleicht die Ausgabe eines Agenten mit einem Referenzbestand an Problemen für Pull Requests und berücksichtigt Schweregrad und Kategorie der Befunde gesondert.
Was genau bewertet ReviewBench?
Der Datensatz umfasst 219 öffentliche Pull Requests aus 187 Repositories mit offen lizenziertem Code in 19 Sprachen. GitHub zufolge analysierte das Unternehmen bei der Zusammenstellung des Korpus die Verteilung von mehr als 103,9 Millionen PRs. Größe der Repositories und Sprachen wurden an der allgemeinen GitHub-Stichprobe ausgerichtet; die Größe der Änderungen wurde bewusst zugunsten umfangreicherer PRs verschoben, die sich für ein Review eignen.
Für jeden PR enthält der Benchmark Referenzkommentare mit Kennzeichnungen für Schweregrad und Kategorie – etwa Korrektheit, Sicherheit, Zuverlässigkeit, Wartbarkeit und Tests. ReviewBench berechnet die Präzision: Welcher Anteil der Kommentare eines Agenten entspricht tatsächlichen Problemen? Außerdem misst er den Recall: Welchen Anteil der bekannten Probleme hat der Agent erkannt? Der Fβ-Wert ermöglicht es, die relative Gewichtung dieser beiden Kriterien anzupassen: Ein höheres Gewicht für den Recall eignet sich, wenn möglichst viele Probleme gefunden werden sollen, ein höheres Gewicht für die Präzision, wenn störende Kommentare reduziert werden sollen.
Wie die Zahlen von GitHub zu verstehen sind
Die Veröffentlichung nennt eine Übereinstimmung von 96,6 % zwischen der Kennzeichnung in ReviewBench und einer unabhängigen Nachprüfung durch erfahrene Ingenieure. Dieser Wert misst die Übereinstimmung bei Expertenbewertungen der Referenzbefunde und nicht die Genauigkeit eines KI-Agenten.
Separat beschrieb GitHub einen internen A/B-Test eines Modell-Ensembles für Copilot-Code-Reviews. Nach Angaben des Unternehmens stieg gegenüber der Kontrollgruppe der Anteil der Kommentare, auf die entsprechende Codeänderungen folgten, um 8,0 %, der Recall um 13,6 % und das Kommentarvolumen um 61 %; zugleich sanken die Reviewkosten um 8,0 %. Dies sind Ergebnisse eines einzelnen Experiments von GitHub und keine Bewertung aller Agenten oder Zusage, dass andere Teams dieselben Effekte erzielen.
Die Aufschlüsselung der Metriken ist besonders hilfreich, wenn ein Team die Einstellungen für Code-Reviews auswählt. Eine hohe Zahl von Kommentaren kann mit mehr nützlichen Befunden einhergehen, sagt für sich genommen aber nicht aus, wie viele davon sich bestätigt haben. ReviewBench schlüsselt Ergebnisse außerdem nach Schweregrad und Kategorie auf, damit Teams beispielsweise kritische Fehler oder Sicherheitsfragen separat betrachten können.
So können Sie den Benchmark ausprobieren
Der Beschreibung von GitHub zufolge ermöglicht die Forschungsvorschau, den vollständigen Datensatz zu untersuchen, veröffentlichte Ergebnisse zu vergleichen und einen eigenen Agenten auszuführen. Für einen ersten Durchlauf sind 25 PRs vorgesehen; der vollständige Durchlauf umfasst 219 PRs in drei Runden. Teilnehmende stellen ein Container-Image, eine Konfiguration und ihren eigenen Modellschlüssel bereit; die Bewertung erfolgt mit einem gemeinsamen Judge. Die Ergebnisse bleiben privat, bis die Einreichung geprüft und genehmigt wurde.
Der praktische Nutzen eines solchen Durchlaufs besteht darin, einen vergleichbaren Ausgangswert zu erhalten und das System anschließend anhand der eigenen Review-Regeln und der für das Repository typischen Änderungen zu prüfen. Die Anforderungen eines einzelnen Teams – Sprachen, Architektur, Schwellenwerte für Schweregrade und ein akzeptables Maß an Rauschen – können sich von der Zusammensetzung des allgemeinen Korpus unterscheiden.
GitHub zufolge stimmte die Richtung der Änderungen bei den Offline-Bewertungen von ReviewBench in den Experimenten des Unternehmens mit den Ergebnissen im praktischen Einsatz überein. Die veröffentlichten Messwerte beziehen sich auf die eigenen Tests des Unternehmens. Der derzeit verlässlichste Einsatz des Benchmarks besteht daher darin, Agenten anhand einer gemeinsamen Stichprobe zu vergleichen und ihre Stärken zu diagnostizieren. Die Entscheidung über die Einführung sollte sich zusätzlich auf Tests im Arbeitsablauf des jeweiligen Teams stützen.