OpenAI e Ironclad publicaron el 6 de octubre de 2026 los resultados de una evaluación de investigación de agentes de IA que trabajan con procesos contractuales en software empresarial. En 11 tareas, GPT‑6 Astra obtuvo una puntuación media del 55,0 % según los criterios de ejecución, mientras que GPT‑5.6 Sol alcanzó el 41,6 %.

Las tareas abarcaban el trabajo jurídico, comercial y de compras: por ejemplo, configurar un acuerdo de confidencialidad, crear aprobaciones de compras y modificar una cláusula jurídica estándar teniendo en cuenta la jurisdicción seleccionada. OpenAI describe el objetivo del estudio como comprobar la capacidad de un agente para completar un proceso de varias etapas, respetando las reglas de negocio y contrastando el resultado con los requisitos iniciales.
Cómo se midió la ejecución
Empleados de Ironclad y personas que utilizan Ironclad en OpenAI ayudaron a definir las 11 tareas. Cada una se evaluó con entre 8 y 50 criterios, según su complejidad. Para que los modelos practicaran, Ironclad proporcionó entornos alojados de su software; OpenAI informa que mejoró los modelos mediante tareas sintéticas y aprendizaje por refuerzo.
La comparación utilizó la configuración en la que cada modelo obtuvo su puntuación más alta: Max reasoning para Astra y High reasoning para Sol. Según la tabla publicada por OpenAI, el tiempo estimado medio por intento fue de 19,2 minutos para Astra y 37,0 minutos para Sol. Se trata de estimaciones simuladas basadas en la velocidad supuesta de procesamiento y generación, no de una reducción medida del tiempo de los clientes.
Qué indican los resultados
La evaluación muestra cómo se puede comprobar un agente informático a partir del estado final de un flujo de trabajo complejo: un conjunto de criterios permite ver qué requisitos cumplió el sistema y cuáles omitió. Para las empresas que evalúan herramientas similares, una orientación práctica es comprobar no solo acciones aisladas en la interfaz, sino también cómo gestiona el proceso configurado distintas condiciones, como los umbrales de aprobación y las excepciones.
Las cifras corresponden a 11 tareas de investigación y no describen todos los flujos de trabajo de Ironclad. En un ejemplo independiente de la publicación, Astra completó alrededor del 94 % de los criterios en un tiempo estimado de 20 minutos, y Sol, cerca del 85 % en 32 minutos; es un ejemplo de una sola tarea, no un promedio. OpenAI también señala que las tareas sintéticas se crearon a partir de contratos públicos de la base de datos SEC EDGAR, tras filtrar los datos personales; según la empresa, no se utilizaron contratos confidenciales de clientes para el entrenamiento ni la evaluación.
Sunita Verma, directora de tecnología de Ironclad, destacó la importancia de un flujo de trabajo integral. En traducción de la cita de la publicación de OpenAI: «Los agentes deben comprender todo el ciclo de vida del contrato, incluida la conexión entre los flujos de trabajo, y mantener el control en el que confían los equipos».
OpenAI presenta la colaboración como un trabajo de investigación sobre el entrenamiento y la evaluación de modelos. Las puntuaciones publicadas ofrecen una idea de los resultados en las tareas seleccionadas; la publicación no incluye una verificación independiente de la evaluación ni mediciones del rendimiento en un conjunto más amplio de procesos de clientes.
Traducción de la cita: «Los agentes deben comprender todo el ciclo de vida del contrato, incluida la conexión entre los flujos de trabajo, y mantener el control en el que confían los equipos».