OpenAI ve Ironclad, kurumsal yazılımlardaki sözleşme süreçlerinde çalışan yapay zekâ ajanlarına ilişkin araştırma değerlendirmesinin sonuçlarını 6 Ekim 2026’da yayımladı. 11 görevde GPT‑6 Astra, görev kriterlerine göre ortalama %55,0 puan alırken GPT‑5.6 Sol %41,6 puan aldı.

Görevler; gizlilik sözleşmesi oluşturma, satın alma onayları hazırlama ve standart bir hukuki hükmü seçilen yargı bölgesine göre değiştirme gibi hukuk, ticaret ve satın alma çalışmalarını kapsıyordu. OpenAI, araştırmanın amacını, ajanın iş kurallarını koruyup sonucu başlangıçtaki gerekliliklere göre kontrol ederek çok aşamalı bir süreci tamamlayıp tamamlayamadığını sınamak olarak açıklıyor.
Görev performansı nasıl ölçüldü?
Ironclad çalışanları ve OpenAI’de Ironclad kullanan kişiler, 11 görevin belirlenmesine yardımcı oldu. Her görev, zorluğuna bağlı olarak 8–50 kriter üzerinden değerlendirildi. Ironclad, modellerin alıştırma yapması için yazılımının barındırılan ortamlarını sağladı; OpenAI ise modelleri sentetik görevler ve pekiştirmeli öğrenme kullanarak geliştirdiğini belirtiyor.
Karşılaştırmada her modelin en yüksek puanı aldığı ayarlar kullanıldı: Astra için Max reasoning, Sol için High reasoning. OpenAI’nin yayımladığı tabloya göre, deneme başına ortalama tahmini süre Astra için 19,2 dakika, Sol için 37,0 dakikaydı. Bunlar, varsayılan işlem ve üretim hızına dayalı simülasyon tahminleridir; müşterilerin zamandan ne kadar tasarruf ettiğine ilişkin ölçümler değildir.
Sonuçlar ne gösteriyor?
Değerlendirme, bir bilgisayar ajanının karmaşık bir iş akışının nihai durumuna göre nasıl sınanabileceğini gösteriyor: kriter kümesi, sistemin hangi gereklilikleri yerine getirip hangilerini atladığını görmeye olanak tanıyor. Benzer araçları değerlendiren şirketler için pratik bir ölçüt, yalnızca arayüzdeki tek tek eylemleri değil, yapılandırılmış bir sürecin onay eşikleri ve istisnalar gibi farklı koşulları nasıl ele aldığını da kontrol etmektir.
Rakamlar, 11 araştırma görevine ilişkindir ve Ironclad’ın tüm iş akışlarını tanımlamaz. Yayındaki ayrı bir örnekte Astra, tahmini 20 dakikada kriterlerin yaklaşık %94’ünü; Sol ise 32 dakikada yaklaşık %85’ini yerine getirdi. Bu, tek bir göreve ait örnektir; ortalama sonuçları göstermez. OpenAI ayrıca sentetik görevlerin, kişisel veriler filtrelendikten sonra SEC EDGAR veritabanındaki kamuya açık sözleşmeler temel alınarak oluşturulduğunu belirtiyor; şirketin açıklamasına göre, eğitim ve değerlendirmede müşterilerin gizli sözleşmeleri kullanılmadı.
Ironclad’ın teknik direktörü Sunita Verma, iş akışının bütününün önemini vurguladı. OpenAI’nin yayımındaki alıntının çevirisi: “Ajanların, iş akışları arasındaki bağlantılar da dâhil olmak üzere sözleşmenin tüm yaşam döngüsünü anlaması ve ekiplerin güvendiği kontrolü koruması gerekiyor.”
OpenAI, bu iş birliğini modellerin eğitimi ve değerlendirilmesine yönelik bir araştırma çalışması olarak nitelendiriyor. Yayımlanan puanlar, seçilen görevlerdeki sonuçlar hakkında fikir veriyor; yayında değerlendirmenin bağımsız doğrulaması veya daha geniş bir müşteri süreçleri kümesindeki performans ölçümleri yer almıyor.
Alıntının çevirisi: “Ajanların, iş akışları arasındaki bağlantılar da dâhil olmak üzere sözleşmenin tüm yaşam döngüsünü anlaması ve ekiplerin güvendiği kontrolü koruması gerekiyor.”