OpenAI e Ironclad publicaram os resultados de uma avaliação de pesquisa em 6 de outubro de 2026, sobre agentes de IA que trabalham com processos contratuais em software empresarial. Nas 11 tarefas, GPT‑6 Astra obteve uma pontuação média de 55,0% segundo os critérios de execução, enquanto GPT‑5.6 Sol alcançou 41,6%.

As tarefas abrangiam trabalho jurídico, comercial e de compras: por exemplo, configurar um acordo de confidencialidade, criar aprovações de compras e alterar uma cláusula jurídica padrão considerando a jurisdição selecionada. A OpenAI descreve o objetivo da pesquisa como testar a capacidade de um agente de concluir um processo com várias etapas, preservando as regras de negócio e conferindo o resultado com os requisitos originais.
Como a execução foi medida
Funcionários da Ironclad e pessoas que usam a Ironclad na OpenAI ajudaram a definir as 11 tarefas. Cada uma foi avaliada com base em 8 a 50 critérios, conforme sua complexidade. Para a prática dos modelos, a Ironclad forneceu ambientes hospedados de seu software; a OpenAI informa que aprimorou os modelos com tarefas sintéticas e aprendizado por reforço.
A comparação usou as configurações em que cada modelo alcançou sua maior pontuação: Max reasoning para Astra e High reasoning para Sol. Segundo a tabela publicada pela OpenAI, o tempo médio estimado de uma tentativa foi de 19,2 minutos para Astra e 37,0 minutos para Sol. São estimativas simuladas com base na velocidade presumida de processamento e geração, não uma redução de tempo medida para os clientes.
O que os resultados indicam
A avaliação mostra como testar um agente computacional pelo estado final de um fluxo de trabalho complexo: um conjunto de critérios permite identificar quais requisitos o sistema cumpriu e quais deixou passar. Para empresas que avaliam ferramentas semelhantes, uma orientação prática é verificar não apenas ações individuais na interface, mas também como o processo configurado lida com condições variadas, como limites de aprovação e exceções.
Os números dizem respeito a 11 tarefas de pesquisa e não descrevem todos os fluxos de trabalho da Ironclad. Em um exemplo separado da publicação, Astra cumpriu cerca de 94% dos critérios em 20 minutos estimados, enquanto Sol cumpriu cerca de 85% em 32 minutos; trata-se de um exemplo de uma tarefa, não de médias. A OpenAI também informa que criou as tarefas sintéticas com base em contratos públicos do banco de dados SEC EDGAR, após filtrar dados pessoais; segundo a empresa, contratos confidenciais de clientes não foram usados no treinamento nem na avaliação.
Sunita Verma, diretora de tecnologia da Ironclad, ressaltou a importância do fluxo de trabalho como um todo. Em tradução da citação da publicação da OpenAI: “Os agentes precisam entender todo o ciclo de vida do contrato, incluindo a conexão entre os fluxos de trabalho, e preservar o controle com que as equipes contam”.
A OpenAI descreve a colaboração como um trabalho de pesquisa sobre treinamento e avaliação de modelos. As pontuações publicadas dão uma ideia dos resultados nas tarefas selecionadas; a publicação não apresenta uma verificação independente da avaliação nem medições de desempenho em um conjunto mais amplo de processos de clientes.
Tradução da citação: “Os agentes precisam entender todo o ciclo de vida do contrato, incluindo a conexão entre os fluxos de trabalho, e preservar o controle com que as equipes contam”.