OpenAI ja Ironclad julkaisivat 6. lokakuuta 2026 tutkimusarvioinnin tulokset tekoälyagenteista, jotka toimivat yritysohjelmistojen sopimusprosesseissa. GPT‑6 Astra sai 11 tehtävässä suorituskriteerien keskiarvoksi 55,0 %, kun taas GPT‑5.6 Sol sai 41,6 %.

Tehtävät kattoivat juridista, kaupallista ja hankintatyötä. Esimerkkejä olivat salassapitosopimuksen määrittäminen, hankintojen hyväksyntäprosessien luominen ja vakioidun juridisen ehdon muuttaminen valitun lainkäyttöalueen mukaiseksi. OpenAI kuvailee tutkimuksen tavoitteeksi selvittää, pystyykö agentti suorittamaan monivaiheisen prosessin liiketoimintasäännöt säilyttäen ja tarkistamaan tuloksen alkuperäisiä vaatimuksia vasten.
Miten suoritusta mitattiin
Ironcladin työntekijät ja OpenAI:ssa Ironcladia käyttävät henkilöt auttoivat määrittelemään 11 tehtävää. Kukin tehtävä arvioitiin monimutkaisuuden mukaan 8–50 kriteerillä. Ironclad tarjosi mallien harjoitteluun ohjelmistonsa isännöityjä ympäristöjä; OpenAI kertoo parantaneensa malleja synteettisten tehtävien ja vahvistusoppimisen avulla.
Vertailussa käytettiin asetuksia, joilla kumpikin malli saavutti parhaat pisteensä: Astralla Max reasoning ja Solilla High reasoning. OpenAI:n julkaistun taulukon mukaan yritys laski yrityksen keskimääräiseksi ajaksi Astralla 19,2 minuuttia ja Solilla 37,0 minuuttia. Nämä ovat arvioita, jotka perustuvat oletettuun käsittely- ja generointinopeuteen, eivät mitattuja asiakkaille syntyneitä ajansäästöjä.
Mitä tulokset kertovat
Arviointi näyttää, miten tietokonetta käyttävää agenttia voidaan testata monimutkaisen työnkulun lopputilan perusteella: kriteeristö tuo esiin, mitkä vaatimukset järjestelmä täytti ja mitkä jäivät täyttymättä. Vastaavia työkaluja arvioiville yrityksille käytännön lähtökohta on tarkastella yksittäisten käyttöliittymätoimintojen lisäksi sitä, miten määritetty prosessi käsittelee erilaisia ehtoja, kuten hyväksymiskynnyksiä ja poikkeuksia.
Luvut koskevat 11 tutkimustehtävää, eivätkä ne kuvaa kaikkia Ironcladin työnkulkuja. Julkaisun erillisessä esimerkissä Astra täytti noin 94 % kriteereistä arviolta 20 minuutissa ja Sol noin 85 % 32 minuutissa; kyseessä on yhden tehtävän esimerkki, eivät keskiarvot. OpenAI kertoo myös, että synteettiset tehtävät laadittiin SEC EDGAR -tietokannan julkisten sopimusten pohjalta henkilötietojen suodattamisen jälkeen. Yhtiön mukaan asiakkaiden luottamuksellisia sopimuksia ei käytetty koulutukseen eikä arviointiin.
Ironcladin teknologiajohtaja Sunita Verma painotti kokonaisvaltaisen työnkulun merkitystä. OpenAI:n julkaisussa olevan sitaatin käännös: ”Agenttien on ymmärrettävä sopimuksen koko elinkaari, myös työnkulkujen yhteydet, ja säilytettävä se hallinta, johon tiimit luottavat.”
OpenAI kuvailee yhteistyötä tutkimustyöksi mallien kouluttamiseksi ja arvioimiseksi. Julkaistut pisteet antavat kuvan tuloksista valituissa tehtävissä; julkaisussa ei esitetä arvioinnin riippumatonta tarkistusta eikä mittauksia toiminnasta laajemmassa asiakasprosessien joukossa.
Sitaatin käännös: ”Agenttien on ymmärrettävä sopimuksen koko elinkaari, myös työnkulkujen yhteydet, ja säilytettävä se hallinta, johon tiimit luottavat.”