jsonscraper

OpenAI i Ironclad oceniły agentów AI w 11 zadaniach związanych z umowami

GPT‑6 Astra uzyskała średnio 55% według kryteriów OpenAI; czas wykonania oszacowano w symulacji

6 października 2026 roku OpenAI i Ironclad opublikowały wyniki badawczej oceny agentów AI pracujących z procesami umownymi w oprogramowaniu dla firm. W 11 zadaniach GPT‑6 Astra uzyskała średni wynik 55,0% według kryteriów wykonania, a GPT‑5.6 Sol — 41,6%.

OpenAI i Ironclad oceniły agentów AI w 11 zadaniach związanych z umowami
Kontekst: W opublikowanej 6 października ocenie OpenAI porównała GPT‑6 Astra i GPT‑5.6 Sol w 11 zadaniach z obszarów prawnych, handlowych i zakupowych Ironclad. Wyniki dotyczą zestawu badawczego, a nie wszystkich procesów pracy na platformie.
Temat wizualny: zarządzanie umowami, prawniczy przepływ pracy, biuro, dokumenty, komputer, Unsplash
OpenAI · obraz wygenerowany przez AI

Zadania obejmowały pracę prawną, handlową i zakupową, na przykład konfigurację umowy o zachowaniu poufności, tworzenie ścieżek akceptacji zakupów oraz zmianę standardowego postanowienia prawnego z uwzględnieniem wybranej jurysdykcji. OpenAI opisuje cel badania jako sprawdzenie, czy agent potrafi przejść przez wieloetapowy proces, zachowując reguły biznesowe i weryfikując wynik względem pierwotnych wymagań.

Jak mierzono wykonanie

Pracownicy Ironclad oraz osoby korzystające z Ironclad w OpenAI pomogły określić 11 zadań. Każde oceniano według 8–50 kryteriów, zależnie od stopnia złożoności. Na potrzeby testów modeli Ironclad udostępniła środowiska swojej platformy; OpenAI informuje, że doskonaliła modele za pomocą zadań syntetycznych i uczenia ze wzmocnieniem.

W porównaniu zastosowano ustawienia, w których każdy model osiągnął swój najwyższy wynik: Max reasoning dla Astra i High reasoning dla Sol. Według opublikowanej tabeli OpenAI średni szacowany czas próby wyniósł 19,2 minuty dla Astra i 37,0 minuty dla Sol. Są to szacunki symulacyjne oparte na zakładanej szybkości przetwarzania i generowania, a nie zmierzone skrócenie czasu pracy klientów.

Co mówią wyniki

Ocena pokazuje, jak można testować agenta komputerowego na podstawie końcowego stanu złożonego przepływu pracy: zestaw kryteriów pozwala sprawdzić, które wymagania system spełnił, a które pominął. Firmom oceniającym podobne narzędzia może posłużyć jako praktyczna wskazówka, by sprawdzać nie tylko pojedyncze działania w interfejsie, lecz także to, jak skonfigurowany proces obsługuje różne warunki, takie jak progi akceptacji i wyjątki.

Unsplash Power
Domenico Loia · Licencja Unsplash

Liczby odnoszą się do 11 zadań badawczych i nie opisują wszystkich procesów pracy w Ironclad. W osobnym przykładzie z publikacji Astra spełniła około 94% kryteriów w szacowanym czasie 20 minut, a Sol — około 85% w 32 minuty; to przykład jednego zadania, a nie średnie wyniki. OpenAI podaje również, że zadania syntetyczne opracowano na podstawie publicznych umów z bazy SEC EDGAR, po odfiltrowaniu danych osobowych; według deklaracji firmy do trenowania i oceny nie wykorzystano poufnych umów klientów.

Sunita Verma, dyrektorka ds. technicznych w Ironclad, podkreśliła znaczenie całościowego przepływu pracy. Tłumaczenie cytatu z publikacji OpenAI: „Agenci muszą rozumieć cały cykl życia umowy, w tym powiązania między przepływami pracy, i zapewniać kontrolę, na której polegają zespoły”.

OpenAI określa współpracę jako prace badawcze nad trenowaniem i oceną modeli. Opublikowane wyniki dają obraz rezultatów uzyskanych w wybranych zadaniach; publikacja nie przedstawia niezależnej weryfikacji oceny ani pomiarów działania w szerszym zestawie procesów klientów.

Keep readingGitHub udostępnia ReviewBench: agentów AI do przeglądu kodu porówna liczba wykrytych błędów
Read the next article

Powiązane artykuły

Zmień lekturę w działającą integrację

Poznaj API danych społecznościowych jsonscraper, testuj zapytania i buduj kolejne procesy.

Poznaj API