jsonscraper

OpenAI och Ironclad utvärderade AI-agenter på 11 avtalsuppgifter

GPT‑6 Astra fick i genomsnitt 55 % enligt OpenAIs kriterier; tidsåtgången beräknades genom simulering

OpenAI och Ironclad publicerade resultaten av en forskningsutvärdering den 6 oktober 2026 av AI-agenter som arbetar med avtalsprocesser i företagsprogramvara. På 11 uppgifter fick GPT‑6 Astra ett genomsnittligt resultat på 55,0 % enligt kriterierna för genomförande, medan GPT‑5.6 Sol fick 41,6 %.

OpenAI och Ironclad utvärderade AI-agenter på 11 avtalsuppgifter
Context: I en utvärdering som publicerades den 6 oktober jämförde OpenAI GPT‑6 Astra och GPT‑5.6 Sol på 11 uppgifter inom Ironclads juridiska arbete, kommersiella processer och inköp. Resultaten gäller en forskningsuppsättning, inte plattformens alla arbetsflöden.
Visual subject: contract management legal workflow office documents computer Unsplash
OpenAI · AI-genererad bild

Uppgifterna omfattade juridiskt arbete, kommersiellt arbete och inköp. De handlade till exempel om att konfigurera ett sekretessavtal, skapa godkännanden för inköp och ändra en juridisk standardklausul med hänsyn till vald jurisdiktion. OpenAI beskriver syftet med studien som att undersöka om en agent kan genomföra en process i flera steg, samtidigt som den följer affärsregler och kontrollerar resultatet mot de ursprungliga kraven.

Så mättes genomförandet

Medarbetare på Ironclad och personer som använder Ironclad på OpenAI hjälpte till att definiera de 11 uppgifterna. Varje uppgift bedömdes utifrån 8–50 kriterier, beroende på hur svår den var. Ironclad tillhandahöll miljöer med sin programvara för modellernas övning. OpenAI uppger att modellerna förbättrades med syntetiska uppgifter och förstärkningsinlärning.

Jämförelsen använde de inställningar där respektive modell hade fått sitt högsta resultat: Max reasoning för Astra och High reasoning för Sol. Enligt OpenAIs publicerade tabell var den genomsnittliga beräknade tiden per försök 19,2 minuter för Astra och 37,0 minuter för Sol. Det rör sig om simulerade uppskattningar baserade på antagen bearbetnings- och genereringshastighet, inte om uppmätta tidsbesparingar för kunder.

Vad resultaten visar

Utvärderingen visar hur en datoragent kan testas utifrån slutresultatet av ett komplext arbetsflöde: en uppsättning kriterier gör det möjligt att se vilka krav systemet uppfyllde och vilka det missade. För företag som utvärderar liknande verktyg är det praktiska riktmärket att inte bara kontrollera enskilda åtgärder i gränssnittet, utan också hur ett konfigurerat arbetsflöde hanterar olika villkor, till exempel godkännandetrösklar och undantag.

Unsplash Power
Domenico Loia · Unsplash-licensen

Siffrorna gäller 11 forskningsuppgifter och beskriver inte alla Ironclads arbetsflöden. I ett separat exempel i publikationen klarade Astra cirka 94 % av kriterierna på uppskattningsvis 20 minuter, medan Sol klarade cirka 85 % på 32 minuter. Det är ett exempel på en enskild uppgift, inte genomsnittliga resultat. OpenAI uppger också att de syntetiska uppgifterna skapades utifrån offentliga avtal från databasen SEC EDGAR efter att personuppgifter hade filtrerats bort. Enligt företaget användes inte kundernas privata avtal för träning eller utvärdering.

Sunita Verma, teknisk chef på Ironclad, betonade vikten av ett sammanhållet arbetsflöde. I översättning av citatet i OpenAIs publikation: ”Agenter måste förstå avtalets hela livscykel, inklusive hur arbetsflöden hänger samman, och bevara den kontroll som teamen förlitar sig på.”

OpenAI beskriver samarbetet som forskningsarbete kring träning och utvärdering av modeller. De publicerade resultaten ger en bild av prestationerna på utvalda uppgifter; publikationen redovisar ingen oberoende granskning av utvärderingen eller mätningar av arbete med en bredare uppsättning kundprocesser.

Keep readingGitHub lanserar ReviewBench: AI-granskare ska jämföras utifrån upptäckta buggar
Read the next article

Relaterade artiklar

Breaking News · Nyheter

GitHub lanserar ReviewBench: AI-granskare ska jämföras utifrån upptäckta buggar

Den 5 oktober presenterade GitHub ReviewBench, en forskningsförhandsversion av en benchmark för kodgranskande agenter. Måtten skiljer mellan upptäckta problem, missar och onödigt brus, medan företagets resultat från ett internt A/B-test beskriver ett enskilt experiment – inte någon allmän ranking av modeller.

Launches · Nyheter

Mistral Large 4 är nu tillgänglig via API – öppna vikter utlovas senare

Mistral har öppnat Large 4 för testning via API och planerar att släppa vikterna i slutet av oktober. Dokumentationen beskriver en MoE-modell med multimodal inmatning och en kontext på upp till en miljon token; de publicerade parameteruppgifterna skiljer sig åt mellan dokumentationen och tillkännagivandet.

Gör det du läser till en fungerande integration

Utforska jsonscrapers API:er för social data, testa anrop och bygg nästa arbetsflöde.

Utforska API:er