jsonscraper

OpenAI e Ironclad valutano gli agenti IA su 11 attività contrattuali

GPT‑6 Astra ha ottenuto una media del 55% secondo i criteri di OpenAI; i tempi di esecuzione sono stati stimati tramite simulazione

Il 6 ottobre 2026, OpenAI e Ironclad hanno pubblicato i risultati di una valutazione di ricerca su agenti IA che operano nei flussi di lavoro contrattuali all'interno di software aziendali. Nelle 11 attività, GPT‑6 Astra ha ottenuto un punteggio medio del 55,0% secondo i criteri di completamento, mentre GPT‑5.6 Sol ha raggiunto il 41,6%.

OpenAI e Ironclad valutano gli agenti IA su 11 attività contrattuali
Contesto: nella valutazione pubblicata il 6 ottobre, OpenAI ha confrontato GPT‑6 Astra e GPT‑5.6 Sol su 11 attività nei processi legali, commerciali e di approvvigionamento di Ironclad. I risultati riguardano un insieme di prove di ricerca, non tutti i flussi di lavoro della piattaforma.
Soggetto visivo: gestione dei contratti, flusso di lavoro legale, ufficio, documenti, computer, Unsplash
OpenAI · Immagine generata dall'IA

Le attività riguardavano il lavoro legale, commerciale e di approvvigionamento: per esempio, configurare un accordo di riservatezza, creare approvazioni per gli acquisti e modificare una clausola giuridica standard tenendo conto della giurisdizione selezionata. OpenAI descrive l'obiettivo della ricerca come la verifica della capacità di un agente di completare un processo articolato in più fasi, rispettando le regole aziendali e confrontando il risultato con i requisiti iniziali.

Come è stata misurata l'esecuzione

I dipendenti di Ironclad e le persone di OpenAI che utilizzano Ironclad hanno contribuito a definire le 11 attività. Ognuna è stata valutata in base a un numero di criteri compreso tra 8 e 50, a seconda della complessità. Per esercitare i modelli, Ironclad ha fornito ambienti ospitati del proprio software; OpenAI riferisce di aver migliorato i modelli usando attività sintetiche e l'apprendimento per rinforzo.

Nel confronto sono state utilizzate le configurazioni con cui ciascun modello aveva ottenuto il punteggio più alto: Max reasoning per Astra e High reasoning per Sol. Secondo la tabella pubblicata da OpenAI, il tempo medio simulato per tentativo è stato di 19,2 minuti per Astra e 37,0 minuti per Sol. Si tratta di stime simulate basate sulla velocità presunta di elaborazione e generazione, non di una riduzione misurata dei tempi per i clienti.

Cosa indicano i risultati

La valutazione mostra come si possa verificare un agente informatico esaminando lo stato finale di un flusso di lavoro complesso: una serie di criteri consente di vedere quali requisiti il sistema ha soddisfatto e quali ha trascurato. Per le aziende che valutano strumenti simili, un'indicazione pratica è verificare non soltanto le singole azioni nell'interfaccia, ma anche il modo in cui il processo configurato gestisce condizioni diverse, come le soglie di approvazione e le eccezioni.

Unsplash Power
Domenico Loia · Licenza Unsplash

I dati riguardano 11 attività di ricerca e non descrivono tutti i flussi di lavoro di Ironclad. In un esempio separato riportato nella pubblicazione, Astra ha soddisfatto circa il 94% dei criteri in 20 minuti stimati, mentre Sol ne ha soddisfatti circa l'85% in 32 minuti; è un esempio relativo a una singola attività, non un risultato medio. OpenAI afferma inoltre che le attività sintetiche sono state create sulla base di contratti pubblici del database SEC EDGAR, dopo aver filtrato i dati personali; secondo l'azienda, i contratti riservati dei clienti non sono stati utilizzati per l'addestramento o la valutazione.

Sunita Verma, direttrice tecnica di Ironclad, ha sottolineato l'importanza di considerare il flusso di lavoro nel suo insieme. Traduzione della citazione contenuta nella pubblicazione di OpenAI: «Gli agenti devono comprendere l'intero ciclo di vita del contratto, compresi i collegamenti tra i flussi di lavoro, e mantenere il controllo su cui fanno affidamento i team».

OpenAI definisce la collaborazione un'attività di ricerca sull'addestramento e la valutazione dei modelli. I punteggi pubblicati offrono un'indicazione dei risultati sulle attività selezionate; la pubblicazione non riporta una verifica indipendente della valutazione né misurazioni delle prestazioni su un insieme più ampio di processi dei clienti.

Keep readingGitHub lancia ReviewBench: i revisori IA saranno confrontati in base ai difetti individuati
Read the next article

Articoli correlati

Trasforma ciò che leggi in un'integrazione funzionante

Esplora le API per dati social di jsonscraper, prova le richieste e crea il tuo prossimo flusso di lavoro.

Esplora API