Anthropic'in yapay zekâ Ar-Ge'sinin %26'sını Claude yönetiyor

Anthropic, 17 Eylül 2026'da “Öncü laboratuvarlarda yapay zekâ gelişiminin hızını anlamaya yönelik ölçümler” başlıklı bir yazı yayımladı ve öncü bir yapay zekâ laboratuvarının daha önce açıkça söylemediği bir rakamı kayıtlara geçirdi: kendi model araştırmasının ne kadarını artık kendi modeli yapıyor. Şirkete göre Ağustos 2026 itibarıyla Claude, model Ar-Ge çalışmasının %26'sını “yönetiyor” — Anthropic'in tanımıyla bu, modelin üst düzey bir yönergeden yola çıkarak görevin büyük bölümünü baştan sona tamamlaması, insanın ise denetlemesi anlamına geliyor. Şirketin kendi grafiği aynı oranı Mart 2026'da %1, Şubat'ta ise %1'in altında gösteriyor.
Açıklama, sektörün öncü geliştirmenin ne kadar hızlı ilerlemesi gerektiğini tartıştığı bir dönemde geldi ve Anthropic ikisini açıkça birbirine bağlıyor: yönetim kurulu başkanı ve CEO'su Dario Amodei'nin çağrısı doğrultusunda hız konusunda bir eşgüdüm sağlanırsa bu rakamların değişmesini beklediğini yazıyor. Şirket, her geliştiricinin aynı üç ölçümü yayımlamasını öneriyor: yapay zekâ Ar-Ge'sinin ne kadarı yapay zekâ tarafından yapılıyor, ajanların eylemleri ne kadar denetleniyor ve hesaplama gücü nasıl dağıtılıyor.
Yöntem en az başlıktaki rakam kadar önemli. Anthropic bu ölçüte Anthropic Ar-Ge Otomasyon Endeksi adını veriyor ve görevleri Epoch AI'ın geliştirdiği altı kademeli bir otomasyon ölçeğinde değerlendiriyor: AL0 (hiç yapay zekâ katılımı yok) ile AL5 (döngüde insan olmadan tam özerk) arasında. Temmuz 2026'nın her haftası için, model Ar-Ge döngüsünü oluşturan her bölümden personelin %20'si rastgele seçildi; bir Claude araştırma ajanı seçilen kişilerin Slack mesajlarını ve kurum içi belgelerini okuyarak görevlerini listeledi ve yaklaşık 15.000 ayrıntılı görev çıktı. Ardından ayrı bir Claude hakem modeli her birini puanladı. Bu hakem, insan değerlendiricilerle %59 oranında birebir aynı sonuca vardı — personelin kendi arasındaki birebir uyum %35'ti — ve %97 oranında en fazla bir kademe farkla eşleşti.
İki ölçüm daha ölçeği ortaya koyuyor. Ağustos 2026'da Anthropic'in en çok kullanılan kurum içi platformunda herhangi bir anda yaklaşık 30.000 ajan araştırma ve mühendislik işi yapıyordu. O ay incelenen bir milyardan fazla ajan kararının %0,002'si — yaklaşık 47.000'de 1'i — bir izleyici tarafından engellendi; haftada yaklaşık 100.000 kayıt işaretleniyor ve yaklaşık 50'si insan incelemesine taşınıyor. 13–20 Temmuz haftasında yapay zekâ Ar-Ge'sine giden hesaplama gücünün yaklaşık %6'sı, yapay zekâ yürütücülüğündeki Ar-Ge'ye giden gücün ise yaklaşık %12'si güvenlik çalışmasına ayrıldı.
Çekinceler şirketin kendisine ait. Tüm rakamlar şirketin kendi beyanı ve dış bir tarafça denetlenmiş değil; Anthropic, iç risk ekiplerininkine benzer erişime sahip, birden fazla kuruluştan bağımsız değerlendiricileri bünyesine yerleştirmeyi planladığını söylüyor. Görev listesinin Temmuz 2026 tabanında dondurulmuş olduğunu, dolayısıyla endeksin o tarihte insanların yaptığı işin otomasyonunu ölçtüğünü de belirtiyor. Claude, ölçüme giren hiçbir Ar-Ge görevinde AL5 seviyesine ulaşmış değil.
Şeffaflık notu: NewUJ'un editoryal süreci Anthropic'in Claude modellerini kullanıyor.
Kaynaklar
- AnthropicBirincil kaynak
- Unite.AIİkincil
- BigGo Financeİkincil
- Mixedİkincil
İlgili
Universal ve Sony'den Suno'ya 60.202 kayıtlık dava
Alibaba 146 bulgu tarayan BT yapay zekâsını açtı
Claude 30+ biyoloji modelini 4 kat hızlandırdı, yarışma açıldı
Kral Charles'tan yapay zekâ liderlerine denetim çağrısı
Google Home, Claude ve diğer yapay zekâ ajanlarına açılıyor
Huawei'nin 4.096 çipli sistemi 48 bin optik modülü 5.500'e indirdi
Anthropic Cowork'ü Claude'a Kattı, Docs ve Slides'ı Açtı
OpenAI: Modellerimiz 6 vakada hata gizledi, veri uydurdu
Şimdi trend
- Dujuan Tayfunu Tokyo'ya Yaklaşıyor, Chiba'da Trenler Durdu
- AI'ı yavaşlatma anlaşmasına dört aboneden rekabet davası
- Anthropic'te kasım halka arzı: 2 trilyon dolar değerleme
- Check Point'te 9,8 Puanlı Açık: Root Yetkisiyle Kod Çalıştırma
- Jamaika'da Karaya Vuran Balinayı Köpekbalıkları Yiyor
- Azure AI Foundry'de CVSS 10.0 açık: Microsoft arka planda kapattı
- NASA'dan SpaceX'e 3 ISS uçuşu için 946 milyon dolar
- Google: Gemini mayıs testinde üç gerçek şirkete sızdı
Yorumlar
Henüz yorum yok. İlk yorumu sen yaz.