jsonscraper

OpenAI e Ironclad evaluaron agentes de IA en 11 tareas contractuales

GPT‑6 Astra obtuvo una media del 55 % según los criterios de OpenAI; la empresa estimó el tiempo mediante una simulación

OpenAI e Ironclad publicaron el 6 de octubre de 2026 los resultados de una evaluación de investigación de agentes de IA que trabajan con procesos contractuales en software empresarial. En 11 tareas, GPT‑6 Astra obtuvo una puntuación media del 55,0 % según los criterios de ejecución, mientras que GPT‑5.6 Sol alcanzó el 41,6 %.

OpenAI e Ironclad evaluaron agentes de IA en 11 tareas contractuales
Contexto: En una evaluación publicada el 6 de octubre, OpenAI comparó GPT‑6 Astra y GPT‑5.6 Sol en 11 tareas de los procesos jurídicos, comerciales y de compras de Ironclad. Los resultados corresponden a un conjunto de investigación, no a todos los flujos de trabajo de la plataforma.
Tema visual: gestión de contratos, flujo de trabajo jurídico, documentos de oficina, ordenador, Unsplash
OpenAI · imagen generada por IA

Las tareas abarcaban el trabajo jurídico, comercial y de compras: por ejemplo, configurar un acuerdo de confidencialidad, crear aprobaciones de compras y modificar una cláusula jurídica estándar teniendo en cuenta la jurisdicción seleccionada. OpenAI describe el objetivo del estudio como comprobar la capacidad de un agente para completar un proceso de varias etapas, respetando las reglas de negocio y contrastando el resultado con los requisitos iniciales.

Cómo se midió la ejecución

Empleados de Ironclad y personas que utilizan Ironclad en OpenAI ayudaron a definir las 11 tareas. Cada una se evaluó con entre 8 y 50 criterios, según su complejidad. Para que los modelos practicaran, Ironclad proporcionó entornos alojados de su software; OpenAI informa que mejoró los modelos mediante tareas sintéticas y aprendizaje por refuerzo.

La comparación utilizó la configuración en la que cada modelo obtuvo su puntuación más alta: Max reasoning para Astra y High reasoning para Sol. Según la tabla publicada por OpenAI, el tiempo estimado medio por intento fue de 19,2 minutos para Astra y 37,0 minutos para Sol. Se trata de estimaciones simuladas basadas en la velocidad supuesta de procesamiento y generación, no de una reducción medida del tiempo de los clientes.

Qué indican los resultados

La evaluación muestra cómo se puede comprobar un agente informático a partir del estado final de un flujo de trabajo complejo: un conjunto de criterios permite ver qué requisitos cumplió el sistema y cuáles omitió. Para las empresas que evalúan herramientas similares, una orientación práctica es comprobar no solo acciones aisladas en la interfaz, sino también cómo gestiona el proceso configurado distintas condiciones, como los umbrales de aprobación y las excepciones.

Unsplash Power
Domenico Loia · Licencia de Unsplash

Las cifras corresponden a 11 tareas de investigación y no describen todos los flujos de trabajo de Ironclad. En un ejemplo independiente de la publicación, Astra completó alrededor del 94 % de los criterios en un tiempo estimado de 20 minutos, y Sol, cerca del 85 % en 32 minutos; es un ejemplo de una sola tarea, no un promedio. OpenAI también señala que las tareas sintéticas se crearon a partir de contratos públicos de la base de datos SEC EDGAR, tras filtrar los datos personales; según la empresa, no se utilizaron contratos confidenciales de clientes para el entrenamiento ni la evaluación.

Sunita Verma, directora de tecnología de Ironclad, destacó la importancia de un flujo de trabajo integral. En traducción de la cita de la publicación de OpenAI: «Los agentes deben comprender todo el ciclo de vida del contrato, incluida la conexión entre los flujos de trabajo, y mantener el control en el que confían los equipos».

OpenAI presenta la colaboración como un trabajo de investigación sobre el entrenamiento y la evaluación de modelos. Las puntuaciones publicadas ofrecen una idea de los resultados en las tareas seleccionadas; la publicación no incluye una verificación independiente de la evaluación ni mediciones del rendimiento en un conjunto más amplio de procesos de clientes.

Keep readingGitHub presenta ReviewBench: los revisores de IA se compararán por los defectos que detecten
Read the next article

Artículos relacionados

Breaking News · Noticias

GitHub presenta ReviewBench: los revisores de IA se compararán por los defectos que detecten

El 5 de octubre, GitHub presentó ReviewBench, una versión preliminar de investigación de un benchmark para agentes que revisan código. Sus métricas distinguen entre problemas detectados, omisiones y ruido innecesario, mientras que los resultados de la prueba A/B interna de la empresa describen un experimento concreto, no una clasificación general de modelos.

Convierte lo que lees en una integración funcional

Explora las API de datos sociales de jsonscraper, prueba solicitudes y crea tu próximo flujo de trabajo.

Explorar APIs