jsonscraper

OpenAI ja Ironclad arvioivat tekoälyagentteja 11 sopimustehtävässä

GPT‑6 Astra sai OpenAI:n kriteereillä keskimäärin 55 %; suoritusaika arvioitiin simulaatiolla

OpenAI ja Ironclad julkaisivat 6. lokakuuta 2026 tutkimusarvioinnin tulokset tekoälyagenteista, jotka toimivat yritysohjelmistojen sopimusprosesseissa. GPT‑6 Astra sai 11 tehtävässä suorituskriteerien keskiarvoksi 55,0 %, kun taas GPT‑5.6 Sol sai 41,6 %.

OpenAI ja Ironclad arvioivat tekoälyagentteja 11 sopimustehtävässä
Context: OpenAI vertasi 6. lokakuuta julkaistussa arvioinnissa GPT‑6 Astraa ja GPT‑5.6 Solia 11 tehtävässä Ironcladin juridisissa, kaupallisissa ja hankintaprosesseissa. Tulokset kuvaavat tutkimusaineistoa, eivät kaikkia alustan työnkulkuja.
Visual subject: contract management legal workflow office documents computer Unsplash
OpenAI · tekoälyn luoma kuva

Tehtävät kattoivat juridista, kaupallista ja hankintatyötä. Esimerkkejä olivat salassapitosopimuksen määrittäminen, hankintojen hyväksyntäprosessien luominen ja vakioidun juridisen ehdon muuttaminen valitun lainkäyttöalueen mukaiseksi. OpenAI kuvailee tutkimuksen tavoitteeksi selvittää, pystyykö agentti suorittamaan monivaiheisen prosessin liiketoimintasäännöt säilyttäen ja tarkistamaan tuloksen alkuperäisiä vaatimuksia vasten.

Miten suoritusta mitattiin

Ironcladin työntekijät ja OpenAI:ssa Ironcladia käyttävät henkilöt auttoivat määrittelemään 11 tehtävää. Kukin tehtävä arvioitiin monimutkaisuuden mukaan 8–50 kriteerillä. Ironclad tarjosi mallien harjoitteluun ohjelmistonsa isännöityjä ympäristöjä; OpenAI kertoo parantaneensa malleja synteettisten tehtävien ja vahvistusoppimisen avulla.

Vertailussa käytettiin asetuksia, joilla kumpikin malli saavutti parhaat pisteensä: Astralla Max reasoning ja Solilla High reasoning. OpenAI:n julkaistun taulukon mukaan yritys laski yrityksen keskimääräiseksi ajaksi Astralla 19,2 minuuttia ja Solilla 37,0 minuuttia. Nämä ovat arvioita, jotka perustuvat oletettuun käsittely- ja generointinopeuteen, eivät mitattuja asiakkaille syntyneitä ajansäästöjä.

Mitä tulokset kertovat

Arviointi näyttää, miten tietokonetta käyttävää agenttia voidaan testata monimutkaisen työnkulun lopputilan perusteella: kriteeristö tuo esiin, mitkä vaatimukset järjestelmä täytti ja mitkä jäivät täyttymättä. Vastaavia työkaluja arvioiville yrityksille käytännön lähtökohta on tarkastella yksittäisten käyttöliittymätoimintojen lisäksi sitä, miten määritetty prosessi käsittelee erilaisia ehtoja, kuten hyväksymiskynnyksiä ja poikkeuksia.

Unsplash Power
Domenico Loia · Unsplash-lisenssi

Luvut koskevat 11 tutkimustehtävää, eivätkä ne kuvaa kaikkia Ironcladin työnkulkuja. Julkaisun erillisessä esimerkissä Astra täytti noin 94 % kriteereistä arviolta 20 minuutissa ja Sol noin 85 % 32 minuutissa; kyseessä on yhden tehtävän esimerkki, eivät keskiarvot. OpenAI kertoo myös, että synteettiset tehtävät laadittiin SEC EDGAR -tietokannan julkisten sopimusten pohjalta henkilötietojen suodattamisen jälkeen. Yhtiön mukaan asiakkaiden luottamuksellisia sopimuksia ei käytetty koulutukseen eikä arviointiin.

Ironcladin teknologiajohtaja Sunita Verma painotti kokonaisvaltaisen työnkulun merkitystä. OpenAI:n julkaisussa olevan sitaatin käännös: ”Agenttien on ymmärrettävä sopimuksen koko elinkaari, myös työnkulkujen yhteydet, ja säilytettävä se hallinta, johon tiimit luottavat.”

OpenAI kuvailee yhteistyötä tutkimustyöksi mallien kouluttamiseksi ja arvioimiseksi. Julkaistut pisteet antavat kuvan tuloksista valituissa tehtävissä; julkaisussa ei esitetä arvioinnin riippumatonta tarkistusta eikä mittauksia toiminnasta laajemmassa asiakasprosessien joukossa.

Keep readingGitHub avasi ReviewBenchin: tekoälyarvioijia verrataan löydettyjen virheiden perusteella
Read the next article

Aiheeseen liittyvät

Muuta lukemasi toimivaksi integraatioksi

Tutustu jsonscraperin sosiaalisen datan rajapintoihin, testaa pyyntöjä ja rakenna seuraava työnkulkusi.

Tutki API:t