6 października 2026 roku OpenAI i Ironclad opublikowały wyniki badawczej oceny agentów AI pracujących z procesami umownymi w oprogramowaniu dla firm. W 11 zadaniach GPT‑6 Astra uzyskała średni wynik 55,0% według kryteriów wykonania, a GPT‑5.6 Sol — 41,6%.

Zadania obejmowały pracę prawną, handlową i zakupową, na przykład konfigurację umowy o zachowaniu poufności, tworzenie ścieżek akceptacji zakupów oraz zmianę standardowego postanowienia prawnego z uwzględnieniem wybranej jurysdykcji. OpenAI opisuje cel badania jako sprawdzenie, czy agent potrafi przejść przez wieloetapowy proces, zachowując reguły biznesowe i weryfikując wynik względem pierwotnych wymagań.
Jak mierzono wykonanie
Pracownicy Ironclad oraz osoby korzystające z Ironclad w OpenAI pomogły określić 11 zadań. Każde oceniano według 8–50 kryteriów, zależnie od stopnia złożoności. Na potrzeby testów modeli Ironclad udostępniła środowiska swojej platformy; OpenAI informuje, że doskonaliła modele za pomocą zadań syntetycznych i uczenia ze wzmocnieniem.
W porównaniu zastosowano ustawienia, w których każdy model osiągnął swój najwyższy wynik: Max reasoning dla Astra i High reasoning dla Sol. Według opublikowanej tabeli OpenAI średni szacowany czas próby wyniósł 19,2 minuty dla Astra i 37,0 minuty dla Sol. Są to szacunki symulacyjne oparte na zakładanej szybkości przetwarzania i generowania, a nie zmierzone skrócenie czasu pracy klientów.
Co mówią wyniki
Ocena pokazuje, jak można testować agenta komputerowego na podstawie końcowego stanu złożonego przepływu pracy: zestaw kryteriów pozwala sprawdzić, które wymagania system spełnił, a które pominął. Firmom oceniającym podobne narzędzia może posłużyć jako praktyczna wskazówka, by sprawdzać nie tylko pojedyncze działania w interfejsie, lecz także to, jak skonfigurowany proces obsługuje różne warunki, takie jak progi akceptacji i wyjątki.
Liczby odnoszą się do 11 zadań badawczych i nie opisują wszystkich procesów pracy w Ironclad. W osobnym przykładzie z publikacji Astra spełniła około 94% kryteriów w szacowanym czasie 20 minut, a Sol — około 85% w 32 minuty; to przykład jednego zadania, a nie średnie wyniki. OpenAI podaje również, że zadania syntetyczne opracowano na podstawie publicznych umów z bazy SEC EDGAR, po odfiltrowaniu danych osobowych; według deklaracji firmy do trenowania i oceny nie wykorzystano poufnych umów klientów.
Sunita Verma, dyrektorka ds. technicznych w Ironclad, podkreśliła znaczenie całościowego przepływu pracy. Tłumaczenie cytatu z publikacji OpenAI: „Agenci muszą rozumieć cały cykl życia umowy, w tym powiązania między przepływami pracy, i zapewniać kontrolę, na której polegają zespoły”.
OpenAI określa współpracę jako prace badawcze nad trenowaniem i oceną modeli. Opublikowane wyniki dają obraz rezultatów uzyskanych w wybranych zadaniach; publikacja nie przedstawia niezależnej weryfikacji oceny ani pomiarów działania w szerszym zestawie procesów klientów.
Tłumaczenie cytatu: „Agenci muszą rozumieć cały cykl życia umowy, w tym powiązania między przepływami pracy, i zapewniać kontrolę, na której polegają zespoły”.