jsonscraper

OpenAI e Ironclad avaliaram agentes de IA em 11 tarefas contratuais

GPT‑6 Astra obteve média de 55% segundo os critérios da OpenAI; o tempo de execução foi estimado por simulação

OpenAI e Ironclad publicaram os resultados de uma avaliação de pesquisa em 6 de outubro de 2026, sobre agentes de IA que trabalham com processos contratuais em software empresarial. Nas 11 tarefas, GPT‑6 Astra obteve uma pontuação média de 55,0% segundo os critérios de execução, enquanto GPT‑5.6 Sol alcançou 41,6%.

OpenAI e Ironclad avaliaram agentes de IA em 11 tarefas contratuais
Contexto: Na avaliação publicada em 6 de outubro, a OpenAI comparou GPT‑6 Astra e GPT‑5.6 Sol em 11 tarefas dos fluxos jurídicos, comerciais e de compras da Ironclad. Os resultados descrevem um conjunto de pesquisa, não todos os fluxos de trabalho da plataforma.
Tema visual: gestão de contratos, fluxo de trabalho jurídico, documentos de escritório, computador, Unsplash
OpenAI · imagem gerada por IA

As tarefas abrangiam trabalho jurídico, comercial e de compras: por exemplo, configurar um acordo de confidencialidade, criar aprovações de compras e alterar uma cláusula jurídica padrão considerando a jurisdição selecionada. A OpenAI descreve o objetivo da pesquisa como testar a capacidade de um agente de concluir um processo com várias etapas, preservando as regras de negócio e conferindo o resultado com os requisitos originais.

Como a execução foi medida

Funcionários da Ironclad e pessoas que usam a Ironclad na OpenAI ajudaram a definir as 11 tarefas. Cada uma foi avaliada com base em 8 a 50 critérios, conforme sua complexidade. Para a prática dos modelos, a Ironclad forneceu ambientes hospedados de seu software; a OpenAI informa que aprimorou os modelos com tarefas sintéticas e aprendizado por reforço.

A comparação usou as configurações em que cada modelo alcançou sua maior pontuação: Max reasoning para Astra e High reasoning para Sol. Segundo a tabela publicada pela OpenAI, o tempo médio estimado de uma tentativa foi de 19,2 minutos para Astra e 37,0 minutos para Sol. São estimativas simuladas com base na velocidade presumida de processamento e geração, não uma redução de tempo medida para os clientes.

O que os resultados indicam

A avaliação mostra como testar um agente computacional pelo estado final de um fluxo de trabalho complexo: um conjunto de critérios permite identificar quais requisitos o sistema cumpriu e quais deixou passar. Para empresas que avaliam ferramentas semelhantes, uma orientação prática é verificar não apenas ações individuais na interface, mas também como o processo configurado lida com condições variadas, como limites de aprovação e exceções.

Unsplash Power
Domenico Loia · Licença do Unsplash

Os números dizem respeito a 11 tarefas de pesquisa e não descrevem todos os fluxos de trabalho da Ironclad. Em um exemplo separado da publicação, Astra cumpriu cerca de 94% dos critérios em 20 minutos estimados, enquanto Sol cumpriu cerca de 85% em 32 minutos; trata-se de um exemplo de uma tarefa, não de médias. A OpenAI também informa que criou as tarefas sintéticas com base em contratos públicos do banco de dados SEC EDGAR, após filtrar dados pessoais; segundo a empresa, contratos confidenciais de clientes não foram usados no treinamento nem na avaliação.

Sunita Verma, diretora de tecnologia da Ironclad, ressaltou a importância do fluxo de trabalho como um todo. Em tradução da citação da publicação da OpenAI: “Os agentes precisam entender todo o ciclo de vida do contrato, incluindo a conexão entre os fluxos de trabalho, e preservar o controle com que as equipes contam”.

A OpenAI descreve a colaboração como um trabalho de pesquisa sobre treinamento e avaliação de modelos. As pontuações publicadas dão uma ideia dos resultados nas tarefas selecionadas; a publicação não apresenta uma verificação independente da avaliação nem medições de desempenho em um conjunto mais amplo de processos de clientes.

Keep readingGitHub lança o ReviewBench: revisores de IA serão comparados pelos defeitos encontrados
Read the next article

Artigos relacionados

Breaking News · Notícias

GitHub lança o ReviewBench: revisores de IA serão comparados pelos defeitos encontrados

Em 5 de outubro, o GitHub apresentou o ReviewBench, uma versão preliminar de pesquisa de um benchmark para agentes que revisam código. Suas métricas distinguem problemas encontrados, problemas não detectados e ruído desnecessário; os resultados do teste A/B interno da empresa descrevem um experimento específico, não uma classificação geral de modelos.

Transforme o que lê numa integração funcional

Explore as APIs de dados sociais da jsonscraper, teste pedidos e crie o seu próximo fluxo de trabalho.

Explorar APIs