jsonscraper

OpenAI und Ironclad bewerteten KI-Agenten anhand von 11 Vertragsaufgaben

GPT‑6 Astra erzielte nach den Kriterien von OpenAI durchschnittlich 55 Prozent; die Bearbeitungszeit wurde vom Unternehmen simuliert geschätzt

OpenAI und Ironclad veröffentlichten am 6. Oktober 2026 die Ergebnisse einer Forschungsbewertung von KI-Agenten, die Vertragsprozesse in Unternehmenssoftware bearbeiten. Bei 11 Aufgaben erzielte GPT‑6 Astra nach den Bewertungskriterien eine durchschnittliche Punktzahl von 55,0 Prozent, GPT‑5.6 Sol kam auf 41,6 Prozent.

OpenAI und Ironclad bewerteten KI-Agenten anhand von 11 Vertragsaufgaben
Kontext: In einer am 6. Oktober veröffentlichten Bewertung verglich OpenAI GPT‑6 Astra und GPT‑5.6 Sol anhand von 11 Aufgaben in den Rechts-, Geschäfts- und Beschaffungsprozessen von Ironclad. Die Ergebnisse beziehen sich auf einen Forschungsdatensatz und nicht auf alle Arbeitsabläufe der Plattform.
Bildmotiv: Vertragsmanagement, juristischer Arbeitsablauf, Büro, Dokumente, Computer, Unsplash
OpenAI · KI-generiertes Bild

Die Aufgaben deckten juristische, geschäftliche und beschaffungsbezogene Tätigkeiten ab, etwa das Einrichten einer Geheimhaltungsvereinbarung, das Erstellen von Genehmigungsabläufen für Beschaffungen und das Ändern einer juristischen Standardklausel unter Berücksichtigung der gewählten Gerichtsbarkeit. OpenAI beschreibt das Ziel der Untersuchung als Prüfung, ob ein Agent einen mehrstufigen Prozess durchlaufen, dabei Geschäftsregeln einhalten und das Ergebnis anhand der ursprünglichen Anforderungen überprüfen kann.

Wie die Leistung gemessen wurde

Mitarbeitende von Ironclad sowie Personen, die Ironclad bei OpenAI nutzen, halfen bei der Definition der 11 Aufgaben. Jede Aufgabe wurde je nach Schwierigkeitsgrad anhand von 8 bis 50 Kriterien bewertet. Für die Übung mit den Modellen stellte Ironclad gehostete Umgebungen ihrer Software bereit; OpenAI zufolge verbesserte das Unternehmen die Modelle mithilfe synthetischer Aufgaben und durch Reinforcement Learning.

Für den Vergleich wurden die Einstellungen verwendet, mit denen jedes Modell seine höchste Punktzahl erzielte: Max reasoning für Astra und High reasoning für Sol. Der von OpenAI veröffentlichten Tabelle zufolge betrug die durchschnittlich geschätzte Zeit pro Versuch bei Astra 19,2 Minuten und bei Sol 37,0 Minuten. Dabei handelt es sich um simulierte Schätzungen auf Grundlage einer angenommenen Verarbeitungs- und Generierungsgeschwindigkeit, nicht um eine gemessene Zeitersparnis für Kunden.

Was die Ergebnisse aussagen

Die Bewertung zeigt, wie sich ein Computer-Agent anhand des Endzustands eines komplexen Arbeitsablaufs prüfen lässt: Mithilfe einer Reihe von Kriterien kann festgestellt werden, welche Anforderungen das System erfüllt und welche es übergangen hat. Für Unternehmen, die solche Tools bewerten, ist es sinnvoll, nicht nur einzelne Aktionen in der Benutzeroberfläche zu prüfen, sondern auch, wie ein konfigurierter Prozess mit unterschiedlichen Bedingungen umgeht, etwa Genehmigungsschwellen und Ausnahmen.

Unsplash Power
Domenico Loia · Unsplash-Lizenz

Die Zahlen beziehen sich auf 11 Forschungsaufgaben und beschreiben nicht sämtliche Arbeitsabläufe von Ironclad. In einem separaten Beispiel aus der Veröffentlichung erfüllte Astra innerhalb geschätzter 20 Minuten rund 94 Prozent der Kriterien, Sol in 32 Minuten etwa 85 Prozent; dies ist ein Beispiel für eine einzelne Aufgabe und kein Durchschnittswert. OpenAI gibt außerdem an, die synthetischen Aufgaben auf Grundlage öffentlicher Verträge aus der SEC-EDGAR-Datenbank erstellt und personenbezogene Daten herausgefiltert zu haben. Nach Angaben des Unternehmens wurden vertrauliche Kundenverträge weder zum Training noch zur Bewertung verwendet.

Sunita Verma, Chief Technology Officer von Ironclad, unterstrich die Bedeutung des ganzheitlichen Arbeitsablaufs. In Übersetzung eines Zitats aus der OpenAI-Veröffentlichung: „Agenten müssen den gesamten Vertragslebenszyklus verstehen, einschließlich der Verknüpfung von Arbeitsabläufen, und zugleich die Kontrolle wahren, auf die Teams angewiesen sind.“

OpenAI bezeichnet die Zusammenarbeit als Forschungsarbeit zum Training und zur Bewertung von Modellen. Die veröffentlichten Punktzahlen geben Aufschluss über die Ergebnisse bei ausgewählten Aufgaben; die Veröffentlichung enthält weder eine unabhängige Überprüfung der Bewertung noch Messungen der Leistung in einem breiteren Spektrum von Kundenprozessen.

Keep readingGitHub stellt ReviewBench vor: KI-Reviewer werden anhand gefundener Fehler verglichen
Read the next article

Ähnliche Beiträge

Breaking News · Neuigkeiten

GitHub stellt ReviewBench vor: KI-Reviewer werden anhand gefundener Fehler verglichen

Am 5. Oktober stellte GitHub ReviewBench vor – eine Forschungsvorschau auf einen Benchmark für Code-Review-Agenten. Seine Metriken unterscheiden gefundene Probleme, übersehene Fehler und unnötiges Rauschen. Die Ergebnisse eines internen A/B-Tests des Unternehmens beschreiben ein einzelnes Experiment und keine allgemeine Rangliste von Modellen.

Launches · Neuigkeiten

Mistral Large 4 ist jetzt per API verfügbar – offene Gewichte sollen später folgen

Mistral hat Large 4 zum Testen per API freigegeben und die Veröffentlichung der Gewichte für Ende Oktober angekündigt. Die Dokumentation beschreibt ein MoE-Modell mit multimodalem Input und einem Kontextfenster von bis zu einer Million Token; die veröffentlichten Parameterangaben in Dokumentation und Ankündigung weichen voneinander ab.

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken