Yapay zeka

Anthropic'in yapay zekâ Ar-Ge'sinin %26'sını Claude yönetiyor

tarihinde yayımlandı2 dk okumaYazan: NewUJ Editorial Desk

tarihinde güncellendiyeni bilgiler eklendi

Anthropic'in yapay zekâ Ar-Ge'sinin %26'sını Claude yönetiyor
Fotoğraf: Anthropic
0 0
XWhatsAppTelegramLinkedIn

Anthropic, 17 Eylül 2026'da “Öncü laboratuvarlarda yapay zekâ gelişiminin hızını anlamaya yönelik ölçümler” başlıklı bir yazı yayımladı ve öncü bir yapay zekâ laboratuvarının daha önce açıkça söylemediği bir rakamı kayıtlara geçirdi: kendi model araştırmasının ne kadarını artık kendi modeli yapıyor. Şirkete göre Ağustos 2026 itibarıyla Claude, model Ar-Ge çalışmasının %26'sını “yönetiyor” — Anthropic'in tanımıyla bu, modelin üst düzey bir yönergeden yola çıkarak görevin büyük bölümünü baştan sona tamamlaması, insanın ise denetlemesi anlamına geliyor. Şirketin kendi grafiği aynı oranı Mart 2026'da %1, Şubat'ta ise %1'in altında gösteriyor.

Açıklama, sektörün öncü geliştirmenin ne kadar hızlı ilerlemesi gerektiğini tartıştığı bir dönemde geldi ve Anthropic ikisini açıkça birbirine bağlıyor: yönetim kurulu başkanı ve CEO'su Dario Amodei'nin çağrısı doğrultusunda hız konusunda bir eşgüdüm sağlanırsa bu rakamların değişmesini beklediğini yazıyor. Şirket, her geliştiricinin aynı üç ölçümü yayımlamasını öneriyor: yapay zekâ Ar-Ge'sinin ne kadarı yapay zekâ tarafından yapılıyor, ajanların eylemleri ne kadar denetleniyor ve hesaplama gücü nasıl dağıtılıyor.

Yöntem en az başlıktaki rakam kadar önemli. Anthropic bu ölçüte Anthropic Ar-Ge Otomasyon Endeksi adını veriyor ve görevleri Epoch AI'ın geliştirdiği altı kademeli bir otomasyon ölçeğinde değerlendiriyor: AL0 (hiç yapay zekâ katılımı yok) ile AL5 (döngüde insan olmadan tam özerk) arasında. Temmuz 2026'nın her haftası için, model Ar-Ge döngüsünü oluşturan her bölümden personelin %20'si rastgele seçildi; bir Claude araştırma ajanı seçilen kişilerin Slack mesajlarını ve kurum içi belgelerini okuyarak görevlerini listeledi ve yaklaşık 15.000 ayrıntılı görev çıktı. Ardından ayrı bir Claude hakem modeli her birini puanladı. Bu hakem, insan değerlendiricilerle %59 oranında birebir aynı sonuca vardı — personelin kendi arasındaki birebir uyum %35'ti — ve %97 oranında en fazla bir kademe farkla eşleşti.

İki ölçüm daha ölçeği ortaya koyuyor. Ağustos 2026'da Anthropic'in en çok kullanılan kurum içi platformunda herhangi bir anda yaklaşık 30.000 ajan araştırma ve mühendislik işi yapıyordu. O ay incelenen bir milyardan fazla ajan kararının %0,002'si — yaklaşık 47.000'de 1'i — bir izleyici tarafından engellendi; haftada yaklaşık 100.000 kayıt işaretleniyor ve yaklaşık 50'si insan incelemesine taşınıyor. 13–20 Temmuz haftasında yapay zekâ Ar-Ge'sine giden hesaplama gücünün yaklaşık %6'sı, yapay zekâ yürütücülüğündeki Ar-Ge'ye giden gücün ise yaklaşık %12'si güvenlik çalışmasına ayrıldı.

Çekinceler şirketin kendisine ait. Tüm rakamlar şirketin kendi beyanı ve dış bir tarafça denetlenmiş değil; Anthropic, iç risk ekiplerininkine benzer erişime sahip, birden fazla kuruluştan bağımsız değerlendiricileri bünyesine yerleştirmeyi planladığını söylüyor. Görev listesinin Temmuz 2026 tabanında dondurulmuş olduğunu, dolayısıyla endeksin o tarihte insanların yaptığı işin otomasyonunu ölçtüğünü de belirtiyor. Claude, ölçüme giren hiçbir Ar-Ge görevinde AL5 seviyesine ulaşmış değil.

Şeffaflık notu: NewUJ'un editoryal süreci Anthropic'in Claude modellerini kullanıyor.

Kaynaklar

Bildir / kaldırılmasını iste

İlgili

Yorumlar

Henüz yorum yok. İlk yorumu sen yaz.