Anthropic, Claude’un şirket içindeki yapay zekâ araştırma ve geliştirme çalışmalarında ne ölçüde kullanıldığına ilişkin dikkat çekici veriler paylaştı. Şirketin yayımladığı yeni blog yazısına göre, Claude Anthropic’in yapay zekâ Ar-Ge çalışmalarının yüzde 26’sında işi yüksek seviyeli bir komuttan başlayarak büyük ölçüde uçtan uca yürütebiliyor ve insan çalışanlar bu süreci denetliyor. Anthropic bu çalışma biçimini “AI-led”, yani yapay zekânın yönlendirdiği çalışma olarak tanımlıyor. Şirketin verdiği bilgiye göre Claude’un rolü yalnızca bu yüzde 26’lık bölümle sınırlı değil. Yapay zekâ sistemleri, Anthropic’in araştırma faaliyetlerinin yüzde 90’dan fazlasında en azından işin büyük bölümlerini yakın insan yönlendirmesi altında gerçekleştiriyor.
Bu oranlar, Claude’un şirket çalışanlarının yaptığı araştırma işlerinin büyük kısmına bir şekilde dahil olduğunu gösteriyor. Bununla birlikte Anthropic, ölçülen yapay zekâ Ar-Ge çalışmalarının hiçbir bölümünde Claude’un tamamen otonom biçimde faaliyet göstermediğinin altını çiziyor. Başka bir deyişle sistem bazı görevleri başlangıçtan sona kadar büyük ölçüde kendi başına tamamlayabilse de insan gözetimi süreçten çıkarılmış değil. Şirketin tanımladığı yüzde 26’lık “liderlik” oranında da nihai denetim insan çalışanlarda kalıyor. Bu ayrım, yapay zekâ araçlarının araştırma süreçlerindeki etkinliğini ölçerken yalnızca görev tamamlama oranlarına bakmanın yeterli olmadığını da ortaya koyuyor.
Anthropic yapay zekâ gelişiminin ölçülmesi için üç yöntem öneriyor
Anthropic söz konusu verileri, yapay zekâ geliştirme hızını daha anlaşılır ve karşılaştırılabilir hâle getirmeyi amaçlayan üç ölçüm yönteminden ilki kapsamında oluşturdu. “AI-led AI R&D” olarak adlandırılan bu yaklaşımda, yapay zekâ araştırma ve geliştirme çalışmalarının ne kadarının Claude tarafından yerine getirildiği ölçülüyor. Şirket bunun için kendi kullanım verilerini, Epoch AI tarafından hazırlanan otomasyon derecelendirme ölçeğiyle bir araya getirdi. Bu yöntem sayesinde Claude’un Ağustos 2025’ten bu yana ulaştığı otomasyon seviyelerini gösteren bir grafik oluşturuldu. Anthropic’e göre benzer bir ölçüm, kendi verilerini kullanan diğer ileri düzey yapay zekâ modeli geliştiricileri tarafından da uygulanabilir ve sonuçlar bağımsız üçüncü taraflarca doğrulanabilir.
İLGİNİZİ ÇEKEBİLİR

Claude artık sohbet içinde Word belgeleri ve sunumlar hazırlayabiliyor

OpenAI, Google ve Anthropic yapay zekâ güvenliğinde birlikte hareket ediyor

Google mühendislerine Claude erişimi açtı: Kullanım Antigravity ile sınırlı

Shadowx yapay zekaya giden kurumsal veriyi dışarı çıkmadan maskeliyor

Portable Computer, Windows’ta dosyaları buluta göndermeden işliyor
Şirketin önerdiği ikinci ölçüm alanı, yapay zekâ ajanlarının ne ölçüde denetlendiğine odaklanıyor. Burada ajan faaliyetlerinin ne kadarının insanlar tarafından izlendiği, yapılan işlemlerin ne kadar süre içinde kontrol edildiği ve sistem davranışlarının hangi sıklıkla sorunlu olarak işaretlendiği gibi verilerin takip edilmesi öneriliyor. Anthropic bu tür göstergelerin, giderek daha bağımsız hareket edebilen yapay zekâ ajanlarının gerçek çalışma biçimi hakkında daha somut bilgi sağlayabileceğini düşünüyor. Bunun yanında yalnızca bir ajanın belirli bir görevi tamamlayıp tamamlamadığını ölçmek yerine, bu görevin hangi düzeyde denetim altında gerçekleştirildiğinin de kayda geçirilmesi gerektiğini savunuyor. Böylece şirketler arasında daha doğrudan karşılaştırılabilecek bir güvenlik ve gözetim çerçevesi oluşturulması hedefleniyor.
Üçüncü ölçüm ise yapay zekâ araştırma ve geliştirme faaliyetlerine ayrılan hesaplama kapasitesini takip etmeyi kapsıyor. Anthropic, şirketlerin Ar-Ge çalışmalarına ne kadar bilgi işlem gücü tahsis ettiğinin açıklanmasının, ileri seviye modellerin hangi hızda geliştirildiğini anlamak için kullanılabileceğini belirtiyor. Bu verilerin otomasyon seviyesi ve insan denetimi ölçümleriyle birlikte değerlendirilmesi hâlinde sektörün gelişim temposu hakkında daha geniş bir tablo ortaya çıkabilir. Şirket, daha yüksek şeffaflığın hem kamuoyunun yapay zekâ geliştirme süreçlerini daha iyi izlemesine hem de kontrolden çıkabilecek gelişmelere daha erken müdahale edilmesine yardımcı olabileceği görüşünde.
Günün Öne Çıkan Fırsatları

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
Anthropic CEO’su Dario Amodei de son dönemde yapay zekâ güvenliği ve gelişmiş modellerin denetlenmesi konusunda daha fazla ölçüm yapılması gerektiğini savunuyor. Kaynak metne göre OpenAI da yapay zekâ gelişiminin gerektiğinde yavaşlatılabilmesi fikrine olumlu yaklaştığını daha önce dile getirmiş durumda. Anthropic ise geliştirme uygulamalarının üçüncü taraf değerlendiriciler tarafından incelenmesine izin verme taahhüdünde bulunuyor. Buna rağmen sektör genelinde uygulanacak bağlayıcı denetim mekanizmalarının nasıl şekilleneceği belirsizliğini koruyor. Kaynak metin, ABD Başkanı Donald Trump’ın yapay zekânın risklerini daha sınırlı bir çerçevede değerlendirdiğini belirtiyor; bu nedenle düzenleyici yaklaşımın şirketlerin kendi iç denetimlerinin ötesine ne ölçüde geçeceği konusunda henüz net bir tablo bulunmuyor.
Anthropic’in açıkladığı yüzde 26’lık oran, mevcut yapay zekâ sistemlerinin yalnızca kod yazma veya tekil araştırma görevlerini yerine getiren yardımcı araçlar olmaktan uzaklaşmaya başladığını gösteren somut örneklerden biri. Yine de şirketin kendi verileri Claude’un tam bağımsız bir araştırmacı gibi çalışmadığını, insan yönlendirmesi ve gözetiminin hâlâ belirleyici olduğunu ortaya koyuyor. Bu nedenle açıklanan rakamları doğrudan “işlerin dörtte birinin tamamen yapay zekâya bırakılması” şeklinde yorumlamak doğru değil. Daha isabetli değerlendirme, Claude’un giderek daha fazla görevi yüksek seviyeli talimatlardan hareketle tamamlayabildiği, buna karşılık insan denetiminin sürecin temel unsurlarından biri olmayı sürdürdüğü yönünde. Anthropic’in önerdiği ölçüm standartlarının sektör genelinde benimsenip benimsenmeyeceği ise yapay zekâ şirketlerinin ne kadar ayrıntılı veri paylaşmaya hazır olduğuna bağlı olacak.






