ИИ-ревьюер может оставить десятки комментариев и все равно пропустить дефект, важный для выпуска. 5 октября 2026 года GitHub представила ReviewBench — исследовательское превью бенчмарка, который сравнивает агентов по найденным проблемам, пропускам и точности замечаний.
Для разработчиков важен переход от подсчета комментариев к оценке их содержания. Бенчмарк сопоставляет вывод агента с эталонным набором проблем для pull request и отдельно учитывает серьезность и категорию найденных проблем.
Что именно оценивает ReviewBench
В набор вошли 219 публичных pull request из 187 репозиториев с открытой лицензией и кодом на 19 языках. GitHub сообщает, что при формировании корпуса проанализировала распределение более чем 103,9 млн PR. Размеры репозиториев и распределение языков подбирали с учетом общей выборки GitHub, а долю крупных изменений намеренно увеличили, чтобы включить больше содержательных PR, подходящих для ревью.
Для каждого PR бенчмарк хранит эталонные замечания с метками серьезности и категории — например, корректность, безопасность, надежность, сопровождаемость и тестирование. ReviewBench оценивает точность — долю комментариев агента, соответствующих реальным проблемам, — и полноту — долю известных проблем, обнаруженных агентом. Показатель Fβ позволяет менять относительный вес этих двух критериев: больший вес полноты помогает находить больше проблем, а больший вес точности — сокращать число шумных замечаний.
Как читать цифры GitHub
В публикации указано, что разметка ReviewBench совпала с результатами независимой перепроверки старшими инженерами в 96,6% случаев. Это показатель согласованности экспертных оценок эталонных находок, а не точность какого-либо ИИ-агента.
Отдельно GitHub описала внутренний A/B-тест ансамбля моделей для Copilot code review. По данным компании, по сравнению с контрольной группой доля комментариев, после которых вносили соответствующие изменения кода, выросла на 8,0%, полнота — на 13,6%, объем комментариев — на 61%, а стоимость ревью снизилась на 8,0%. Это результаты одного эксперимента GitHub, а не оценка всех агентов и не гарантия такого же эффекта для других команд.
Разделение метрик особенно полезно, когда команда выбирает настройки ревью. Большой объем замечаний может сопровождаться ростом числа полезных находок, но сам по себе не показывает, сколько из них подтвердилось. ReviewBench также разбивает результаты по серьезности и категориям, чтобы команда могла отдельно оценить, например, критические дефекты или проблемы безопасности.
Как попробовать бенчмарк
Согласно описанию GitHub, исследовательское превью позволяет изучить полный набор данных, сравнить опубликованные результаты и запустить собственный агент. Для предварительного прогона доступны 25 PR; полный запуск охватывает 219 PR в трех раундах. Участник предоставляет образ контейнера, конфигурацию и собственный ключ модели, а оценивание проводится с использованием общего судьи. Результаты остаются частными до проверки и одобрения отправки.
Практический смысл такого прогона — получить сопоставимую исходную точку, а затем проверить систему на собственных правилах ревью и характерных для репозитория изменениях. Условия конкретной команды — языки, архитектура, пороги серьезности и допустимый уровень шума — могут отличаться от состава общего корпуса.
GitHub утверждает, что в ее экспериментах изменения результатов офлайн-оценки ReviewBench совпадали по направлению с изменениями результатов в эксплуатации. Опубликованные измерения относятся к собственным тестам компании. Поэтому сейчас бенчмарк надежнее всего использовать для сравнения агентов на общей выборке и диагностики их сильных сторон, а решение о внедрении принимать также по результатам проверки в рабочем процессе конкретной команды.