OpenAI och Ironclad publicerade resultaten av en forskningsutvärdering den 6 oktober 2026 av AI-agenter som arbetar med avtalsprocesser i företagsprogramvara. På 11 uppgifter fick GPT‑6 Astra ett genomsnittligt resultat på 55,0 % enligt kriterierna för genomförande, medan GPT‑5.6 Sol fick 41,6 %.

Uppgifterna omfattade juridiskt arbete, kommersiellt arbete och inköp. De handlade till exempel om att konfigurera ett sekretessavtal, skapa godkännanden för inköp och ändra en juridisk standardklausul med hänsyn till vald jurisdiktion. OpenAI beskriver syftet med studien som att undersöka om en agent kan genomföra en process i flera steg, samtidigt som den följer affärsregler och kontrollerar resultatet mot de ursprungliga kraven.
Så mättes genomförandet
Medarbetare på Ironclad och personer som använder Ironclad på OpenAI hjälpte till att definiera de 11 uppgifterna. Varje uppgift bedömdes utifrån 8–50 kriterier, beroende på hur svår den var. Ironclad tillhandahöll miljöer med sin programvara för modellernas övning. OpenAI uppger att modellerna förbättrades med syntetiska uppgifter och förstärkningsinlärning.
Jämförelsen använde de inställningar där respektive modell hade fått sitt högsta resultat: Max reasoning för Astra och High reasoning för Sol. Enligt OpenAIs publicerade tabell var den genomsnittliga beräknade tiden per försök 19,2 minuter för Astra och 37,0 minuter för Sol. Det rör sig om simulerade uppskattningar baserade på antagen bearbetnings- och genereringshastighet, inte om uppmätta tidsbesparingar för kunder.
Vad resultaten visar
Utvärderingen visar hur en datoragent kan testas utifrån slutresultatet av ett komplext arbetsflöde: en uppsättning kriterier gör det möjligt att se vilka krav systemet uppfyllde och vilka det missade. För företag som utvärderar liknande verktyg är det praktiska riktmärket att inte bara kontrollera enskilda åtgärder i gränssnittet, utan också hur ett konfigurerat arbetsflöde hanterar olika villkor, till exempel godkännandetrösklar och undantag.
Siffrorna gäller 11 forskningsuppgifter och beskriver inte alla Ironclads arbetsflöden. I ett separat exempel i publikationen klarade Astra cirka 94 % av kriterierna på uppskattningsvis 20 minuter, medan Sol klarade cirka 85 % på 32 minuter. Det är ett exempel på en enskild uppgift, inte genomsnittliga resultat. OpenAI uppger också att de syntetiska uppgifterna skapades utifrån offentliga avtal från databasen SEC EDGAR efter att personuppgifter hade filtrerats bort. Enligt företaget användes inte kundernas privata avtal för träning eller utvärdering.
Sunita Verma, teknisk chef på Ironclad, betonade vikten av ett sammanhållet arbetsflöde. I översättning av citatet i OpenAIs publikation: ”Agenter måste förstå avtalets hela livscykel, inklusive hur arbetsflöden hänger samman, och bevara den kontroll som teamen förlitar sig på.”
OpenAI beskriver samarbetet som forskningsarbete kring träning och utvärdering av modeller. De publicerade resultaten ger en bild av prestationerna på utvalda uppgifter; publikationen redovisar ingen oberoende granskning av utvärderingen eller mätningar av arbete med en bredare uppsättning kundprocesser.
Översättning av citatet: ”Agenter måste förstå avtalets hela livscykel, inklusive hur arbetsflöden hänger samman, och bevara den kontroll som teamen förlitar sig på.”