jsonscraper

OpenAI ve Ironclad, yapay zekâ ajanlarını 11 sözleşme görevinde değerlendirdi

GPT‑6 Astra, OpenAI kriterlerine göre ortalama %55 puan aldı; tamamlanma süresi simülasyonla hesaplandı

OpenAI ve Ironclad, kurumsal yazılımlardaki sözleşme süreçlerinde çalışan yapay zekâ ajanlarına ilişkin araştırma değerlendirmesinin sonuçlarını 6 Ekim 2026’da yayımladı. 11 görevde GPT‑6 Astra, görev kriterlerine göre ortalama %55,0 puan alırken GPT‑5.6 Sol %41,6 puan aldı.

OpenAI ve Ironclad, yapay zekâ ajanlarını 11 sözleşme görevinde değerlendirdi
Bağlam: OpenAI’nin 6 Ekim’de yayımladığı değerlendirmede GPT‑6 Astra ve GPT‑5.6 Sol, Ironclad’ın hukuk, ticaret ve satın alma süreçlerindeki 11 görevde karşılaştırıldı. Sonuçlar, platformun tüm iş akışlarını değil, araştırma amaçlı bir görev kümesini kapsıyor.
Görsel konusu: sözleşme yönetimi, hukuk iş akışı, ofis belgeleri, bilgisayar, Unsplash
OpenAI · Yapay zekâ tarafından oluşturulan görsel

Görevler; gizlilik sözleşmesi oluşturma, satın alma onayları hazırlama ve standart bir hukuki hükmü seçilen yargı bölgesine göre değiştirme gibi hukuk, ticaret ve satın alma çalışmalarını kapsıyordu. OpenAI, araştırmanın amacını, ajanın iş kurallarını koruyup sonucu başlangıçtaki gerekliliklere göre kontrol ederek çok aşamalı bir süreci tamamlayıp tamamlayamadığını sınamak olarak açıklıyor.

Görev performansı nasıl ölçüldü?

Ironclad çalışanları ve OpenAI’de Ironclad kullanan kişiler, 11 görevin belirlenmesine yardımcı oldu. Her görev, zorluğuna bağlı olarak 8–50 kriter üzerinden değerlendirildi. Ironclad, modellerin alıştırma yapması için yazılımının barındırılan ortamlarını sağladı; OpenAI ise modelleri sentetik görevler ve pekiştirmeli öğrenme kullanarak geliştirdiğini belirtiyor.

Karşılaştırmada her modelin en yüksek puanı aldığı ayarlar kullanıldı: Astra için Max reasoning, Sol için High reasoning. OpenAI’nin yayımladığı tabloya göre, deneme başına ortalama tahmini süre Astra için 19,2 dakika, Sol için 37,0 dakikaydı. Bunlar, varsayılan işlem ve üretim hızına dayalı simülasyon tahminleridir; müşterilerin zamandan ne kadar tasarruf ettiğine ilişkin ölçümler değildir.

Sonuçlar ne gösteriyor?

Değerlendirme, bir bilgisayar ajanının karmaşık bir iş akışının nihai durumuna göre nasıl sınanabileceğini gösteriyor: kriter kümesi, sistemin hangi gereklilikleri yerine getirip hangilerini atladığını görmeye olanak tanıyor. Benzer araçları değerlendiren şirketler için pratik bir ölçüt, yalnızca arayüzdeki tek tek eylemleri değil, yapılandırılmış bir sürecin onay eşikleri ve istisnalar gibi farklı koşulları nasıl ele aldığını da kontrol etmektir.

Unsplash Güç
Domenico Loia · Unsplash Lisansı

Rakamlar, 11 araştırma görevine ilişkindir ve Ironclad’ın tüm iş akışlarını tanımlamaz. Yayındaki ayrı bir örnekte Astra, tahmini 20 dakikada kriterlerin yaklaşık %94’ünü; Sol ise 32 dakikada yaklaşık %85’ini yerine getirdi. Bu, tek bir göreve ait örnektir; ortalama sonuçları göstermez. OpenAI ayrıca sentetik görevlerin, kişisel veriler filtrelendikten sonra SEC EDGAR veritabanındaki kamuya açık sözleşmeler temel alınarak oluşturulduğunu belirtiyor; şirketin açıklamasına göre, eğitim ve değerlendirmede müşterilerin gizli sözleşmeleri kullanılmadı.

Ironclad’ın teknik direktörü Sunita Verma, iş akışının bütününün önemini vurguladı. OpenAI’nin yayımındaki alıntının çevirisi: “Ajanların, iş akışları arasındaki bağlantılar da dâhil olmak üzere sözleşmenin tüm yaşam döngüsünü anlaması ve ekiplerin güvendiği kontrolü koruması gerekiyor.”

OpenAI, bu iş birliğini modellerin eğitimi ve değerlendirilmesine yönelik bir araştırma çalışması olarak nitelendiriyor. Yayımlanan puanlar, seçilen görevlerdeki sonuçlar hakkında fikir veriyor; yayında değerlendirmenin bağımsız doğrulaması veya daha geniş bir müşteri süreçleri kümesindeki performans ölçümleri yer almıyor.

Keep readingGitHub ReviewBench’i Açtı: Yapay Zekâ Kod İnceleyicileri Buldukları Hatalara Göre Karşılaştırılacak
Read the next article

İlgili yazılar

Okuduklarınızı çalışan bir entegrasyona dönüştürün

jsonscraper sosyal veri API'lerini keşfedin, istekleri test edin ve sonraki iş akışınızı oluşturun.

API'leri Keşfet