jsonscraper

GitHub lança o ReviewBench: revisores de IA serão comparados pelos defeitos encontrados

O benchmark avalia a abrangência e a precisão dos apontamentos em pull requests; seu conjunto inclui 219 PRs públicos em 19 linguagens.

Um revisor de IA pode deixar dezenas de comentários e ainda assim não detectar um defeito importante para o lançamento. Em 5 de outubro de 2026, o GitHub apresentou o ReviewBench, uma versão preliminar de pesquisa de um benchmark que compara agentes pelos problemas encontrados, pelos problemas não detectados e pela precisão dos apontamentos.

Pessoa programando em um MacBook Pro
Danial Igdery · Licença do Unsplash

Para os desenvolvedores, a mudança importante é deixar de contar comentários e passar a avaliar seu conteúdo. O benchmark compara o resultado do agente com um conjunto de referência de problemas para pull requests e considera separadamente a gravidade e a categoria dos achados.

O que o ReviewBench avalia

O conjunto inclui 219 pull requests públicos de 187 repositórios com código de licença aberta, escritos em 19 linguagens. O GitHub informa que analisou a distribuição de mais de 103,9 milhões de PRs ao montar o corpus. O tamanho dos repositórios e a distribuição das linguagens foram escolhidos tendo como referência a amostra geral do GitHub, enquanto o tamanho das alterações foi deliberadamente direcionado a PRs mais substanciais, adequados para revisão.

Para cada PR, o benchmark armazena apontamentos de referência com rótulos de gravidade e categoria — por exemplo, correção, segurança, confiabilidade, manutenibilidade e testes. O ReviewBench calcula a precisão: que proporção dos comentários do agente corresponde a problemas reais; e a abrangência: que proporção dos problemas conhecidos o agente detectou. A métrica Fβ permite alterar o peso relativo desses dois critérios: dar mais peso à abrangência é útil para encontrar mais problemas, enquanto priorizar a precisão ajuda a reduzir apontamentos ruidosos.

Como interpretar os números do GitHub

A publicação informa uma concordância de 96,6% entre a rotulagem do ReviewBench e uma verificação independente feita por engenheiros seniores. Esse é um indicador de concordância entre avaliações de especialistas sobre os achados de referência, não da precisão de algum agente de IA.

Separadamente, o GitHub descreveu um teste A/B interno de um conjunto de modelos para o Copilot code review. Segundo a empresa, em relação ao grupo de controle, a proporção de comentários seguidos por alterações de código correspondentes aumentou 8,0%, a abrangência cresceu 13,6%, o volume de comentários subiu 61% e o custo da revisão caiu 8,0%. Esses são resultados de um experimento específico do GitHub; não representam uma avaliação de todos os agentes nem uma promessa de que outras equipes terão o mesmo efeito.

Pessoa digitando em um computador portátil
Giorgio Tomassetti · Licença do Unsplash

A separação das métricas é especialmente útil quando uma equipe escolhe as configurações de revisão. Um grande volume de apontamentos pode vir acompanhado de mais achados úteis, mas, por si só, não mostra quantos foram confirmados. O ReviewBench também divide os resultados por gravidade e categoria, para que a equipe possa analisar separadamente, por exemplo, defeitos críticos ou questões de segurança.

Como experimentar o benchmark

De acordo com a descrição do GitHub, a versão preliminar de pesquisa permite explorar o conjunto de dados completo, comparar resultados publicados e executar um agente próprio. Uma avaliação preliminar contempla 25 PRs; a execução completa cobre 219 PRs em três rodadas. O participante fornece uma imagem de contêiner, uma configuração e sua própria chave de modelo, enquanto a avaliação é feita com um juiz compartilhado. Os resultados permanecem privados até que o envio seja analisado e aprovado.

Na prática, o objetivo dessa execução é estabelecer um ponto de partida comparável e, em seguida, testar o sistema com as regras de revisão da própria equipe e com alterações características do repositório. As condições de cada equipe — linguagens, arquitetura, limites de gravidade e nível de ruído aceitável — podem diferir das características do corpus geral.

O GitHub afirma que, em seus experimentos, as mudanças nas avaliações offline do ReviewBench correspondiam, na mesma direção, aos resultados em produção. As medições publicadas referem-se aos testes da própria empresa. Portanto, o uso mais confiável do benchmark neste momento é comparar agentes em uma amostra comum e diagnosticar seus pontos fortes; a decisão de adoção também deve se basear em testes no fluxo de trabalho da equipe específica.

Keep readingGPT-Rosalind: a tarifa entra em vigor, mas a API não está aberta a todos
Read the next article

Artigos relacionados

Transforme o que lê numa integração funcional

Explore as APIs de dados sociais da jsonscraper, teste pedidos e crie o seu próximo fluxo de trabalho.

Explorar APIs