OpenAI a Ironclad 6. října 2026 zveřejnily výsledky výzkumného hodnocení AI agentů pracujících se smluvními procesy v podnikovém softwaru. V 11 úlohách dosáhla GPT‑6 Astra průměrného skóre 55,0 % podle kritérií plnění, zatímco GPT‑5.6 Sol dosáhla 41,6 %.

Úlohy zahrnovaly právní, obchodní a nákupní práci: například nastavení dohody o mlčenlivosti, vytvoření schvalování nákupů a úpravu standardního právního ustanovení s ohledem na zvolenou jurisdikci. OpenAI popisuje cíl výzkumu jako ověření, zda agent dokáže projít vícestupňovým procesem, zachovat obchodní pravidla a zkontrolovat výsledek podle původních požadavků.
Jak se měřilo plnění
Zaměstnanci Ironclad a lidé, kteří v OpenAI používají Ironclad, pomohli definovat 11 úloh. Každá se hodnotila podle 8 až 50 kritérií v závislosti na složitosti. Pro praktické testování modelů poskytla společnost Ironclad hostovaná prostředí svého softwaru; OpenAI uvádí, že modely vylepšovala pomocí syntetických úloh a posilovaného učení.
V porovnání se použila nastavení, v nichž každý model dosáhl svého nejvyššího skóre: Max reasoning pro Astru a High reasoning pro Sol. Podle zveřejněné tabulky OpenAI činila průměrná odhadovaná doba jednoho pokusu u Astry 19,2 minuty a u Sol 37,0 minuty. Jde o simulované odhady založené na předpokládané rychlosti zpracování a generování, nikoli o naměřené zkrácení doby práce zákazníků.
Co výsledky ukazují
Hodnocení ukazuje, jak lze počítačového agenta testovat podle konečného stavu složitého pracovního postupu: sada kritérií umožňuje zjistit, které požadavky systém splnil a které opomenul. Pro firmy, které podobné nástroje hodnotí, je praktickým vodítkem ověřovat nejen jednotlivé úkony v rozhraní, ale také to, jak nakonfigurovaný proces zvládá různé podmínky, například schvalovací limity a výjimky.
Čísla se týkají 11 výzkumných úloh a nepopisují všechny pracovní postupy Ironclad. V samostatném příkladu z publikace Astra splnila přibližně 94 % kritérií za odhadovaných 20 minut, zatímco Sol přibližně 85 % za 32 minut; jde o příklad jedné úlohy, nikoli o průměrné výsledky. OpenAI také uvádí, že syntetické úlohy vytvořila na základě veřejných smluv z databáze SEC EDGAR po odfiltrování osobních údajů; podle tvrzení společnosti nebyly k trénování a hodnocení použity neveřejné smlouvy zákazníků.
Sunita Verma, technická ředitelka Ironclad, zdůraznila důležitost celistvého pracovního postupu. V překladu citátu z publikace OpenAI: „Agenti musí rozumět celému životnímu cyklu smlouvy, včetně propojení pracovních postupů, a zachovat kontrolu, na kterou se týmy spoléhají.“
OpenAI označuje spolupráci za výzkumnou práci zaměřenou na trénování a hodnocení modelů. Zveřejněná skóre ukazují výsledky na vybraných úlohách; publikace neuvádí nezávislé ověření hodnocení ani měření výkonu na širší sadě zákaznických procesů.
Překlad citátu: „Agenti musí rozumět celému životnímu cyklu smlouvy, včetně propojení pracovních postupů, a zachovat kontrolu, na kterou se týmy spoléhají.“