jsonscraper

OpenAI a Ironclad hodnotily AI agenty na 11 smluvních úlohách

GPT‑6 Astra dosáhla podle kritérií OpenAI průměrného skóre 55 %; dobu zpracování firma odhadla simulací

OpenAI a Ironclad 6. října 2026 zveřejnily výsledky výzkumného hodnocení AI agentů pracujících se smluvními procesy v podnikovém softwaru. V 11 úlohách dosáhla GPT‑6 Astra průměrného skóre 55,0 % podle kritérií plnění, zatímco GPT‑5.6 Sol dosáhla 41,6 %.

OpenAI a Ironclad hodnotily AI agenty na 11 smluvních úlohách
Kontext: V hodnocení zveřejněném 6. října OpenAI porovnala GPT‑6 Astra a GPT‑5.6 Sol na 11 úlohách z právních, obchodních a nákupních procesů Ironclad. Výsledky popisují výzkumnou sadu, nikoli všechny pracovní postupy platformy.
Vizuální námět: správa smluv, právní pracovní postup, kancelářské dokumenty, počítač, Unsplash
OpenAI · obrázek vytvořený AI

Úlohy zahrnovaly právní, obchodní a nákupní práci: například nastavení dohody o mlčenlivosti, vytvoření schvalování nákupů a úpravu standardního právního ustanovení s ohledem na zvolenou jurisdikci. OpenAI popisuje cíl výzkumu jako ověření, zda agent dokáže projít vícestupňovým procesem, zachovat obchodní pravidla a zkontrolovat výsledek podle původních požadavků.

Jak se měřilo plnění

Zaměstnanci Ironclad a lidé, kteří v OpenAI používají Ironclad, pomohli definovat 11 úloh. Každá se hodnotila podle 8 až 50 kritérií v závislosti na složitosti. Pro praktické testování modelů poskytla společnost Ironclad hostovaná prostředí svého softwaru; OpenAI uvádí, že modely vylepšovala pomocí syntetických úloh a posilovaného učení.

V porovnání se použila nastavení, v nichž každý model dosáhl svého nejvyššího skóre: Max reasoning pro Astru a High reasoning pro Sol. Podle zveřejněné tabulky OpenAI činila průměrná odhadovaná doba jednoho pokusu u Astry 19,2 minuty a u Sol 37,0 minuty. Jde o simulované odhady založené na předpokládané rychlosti zpracování a generování, nikoli o naměřené zkrácení doby práce zákazníků.

Co výsledky ukazují

Hodnocení ukazuje, jak lze počítačového agenta testovat podle konečného stavu složitého pracovního postupu: sada kritérií umožňuje zjistit, které požadavky systém splnil a které opomenul. Pro firmy, které podobné nástroje hodnotí, je praktickým vodítkem ověřovat nejen jednotlivé úkony v rozhraní, ale také to, jak nakonfigurovaný proces zvládá různé podmínky, například schvalovací limity a výjimky.

Unsplash Power
Domenico Loia · Licence Unsplash

Čísla se týkají 11 výzkumných úloh a nepopisují všechny pracovní postupy Ironclad. V samostatném příkladu z publikace Astra splnila přibližně 94 % kritérií za odhadovaných 20 minut, zatímco Sol přibližně 85 % za 32 minut; jde o příklad jedné úlohy, nikoli o průměrné výsledky. OpenAI také uvádí, že syntetické úlohy vytvořila na základě veřejných smluv z databáze SEC EDGAR po odfiltrování osobních údajů; podle tvrzení společnosti nebyly k trénování a hodnocení použity neveřejné smlouvy zákazníků.

Sunita Verma, technická ředitelka Ironclad, zdůraznila důležitost celistvého pracovního postupu. V překladu citátu z publikace OpenAI: „Agenti musí rozumět celému životnímu cyklu smlouvy, včetně propojení pracovních postupů, a zachovat kontrolu, na kterou se týmy spoléhají.“

OpenAI označuje spolupráci za výzkumnou práci zaměřenou na trénování a hodnocení modelů. Zveřejněná skóre ukazují výsledky na vybraných úlohách; publikace neuvádí nezávislé ověření hodnocení ani měření výkonu na širší sadě zákaznických procesů.

Keep readingGitHub představila ReviewBench: AI recenzenty budou porovnávat podle nalezených chyb
Read the next article

Související články

Breaking News · Novinky

GitHub představila ReviewBench: AI recenzenty budou porovnávat podle nalezených chyb

GitHub 5. října představila ReviewBench, výzkumnou předběžnou verzi benchmarku pro agenty kontrolující kód. Jeho metriky rozlišují nalezené problémy, přehlédnuté chyby a zbytečný šum. Výsledky interního A/B testu společnosti popisují jeden konkrétní experiment, nikoli obecný žebříček modelů.

Proměňte přečtené ve funkční integraci

Prozkoumejte API sociálních dat jsonscraper, testujte požadavky a sestavte další workflow.

Prozkoumat API