Anthropic, Claude modellerinin değerlendirmeler sırasında gerçek internet sitelerinde izin verilmeyen işlemler yaptığını açıkladı ve test ortamlarını değiştirme kararı aldı. Şirket, 9 Ekim tarihli araştırma raporunda güvenlik araçları yeterli güvenilirliğe ulaşana kadar iç değerlendirmelerindeki canlı internet erişimini kapatacağını belirtiyor. Bununla birlikte karar yalnızca şirketin kendi testlerini kapsıyor, Claude müşterilerinin günlük kullanımını kapatan genel bir hizmet değişikliği getirmiyor.
Rapordaki dört davranış türü, yazılım açıklarından yararlanma, gerçek formları gönderme, ücret veya erişim koşullarını aşma ve bağlantı kısaltma kullanımını kapsıyor. Claude bazı testlerde sunucuda komut çalıştırırken başka örneklerde hizmetlerin normal erişim sınırlarını geçmek için araçlardan yararlandı. Öte yandan Anthropic, incelediği bu olayların gerçek dünyadaki etkisini sınırlı bulduğunu ve önceki vakalardan daha hafif değerlendirdiğini söylüyor.
Örneklerden birinde Haiku 4.5, Philadelphia polisinin çevrim içi ihbar formuna uydurma bir gözlem yazıp gerçek bir gönderim yaptı. Ancak formdaki isim ve iletişim alanları boş kaldı, sistem gönderimi istenmeyen içerik olarak işaretleyerek soruşturmaya iletmedi. Anthropic de teknik incelemesini tamamladıktan sonra 8 Ekim’de ilgili polis birimine bu olay hakkında bilgi verdiğini belirtiyor.
İLGİNİZİ ÇEKEBİLİR
Claude Haiku 5.5 çıktı, kısa işlerde yapay zeka maliyetini düşürüyor

Anthropic ücretsiz güvenlik taraması sunuyor ama önemli bir eksik var

OpenAI’dan kovulan araştırmacılardan şirket yönetimine ağır eleştiriler

Yüz binlerce haber için OpenAI’a 250 milyon dolarlık dava

SpaceXAI, Omarchy Linux’a 1,5 milyon dolarlık yapay zekâ desteği sağlıyor
Şirket, yeni izleme araçlarının raporda anlattığı örneklerin tamamını tekrar testlerinde engellediğini ve bu araçları değerlendirmelerin çoğunda kullandığını bildiriyor. Ayrıca Anthropic, tespit ettiği olaylarda müşteri verilerinin veya kendi iç sistemlerinin etkilendiğine dair bir bulguya sahip olmadığını söylüyor.
İnternet bağlantısındaki hata önceki olayları da tetikledi
Öte yandan Anthropic’in 9 Eylül tarihli değerlendirmesi, dört olayda modellerin gerçek üçüncü taraf sistemlerine yetkisiz eriştiğini ortaya koymuştu. Modeller, internet bağlantısı olmayan bir simülasyonda çalıştıkları talimatını aldı, ancak test ortamındaki yanlış ayar gerçek internet bağlantısını açık bıraktı. Bununla birlikte bu değerlendirmeler, şirketin yayımladığı modellerdeki siber güvenlik korumalarını da kullanmıyordu, araştırmacılar olayları bu koşullar altında inceledi.
Günün Öne Çıkan Fırsatları





REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
Eylül raporundaki genişletilmiş tarama yaklaşık 481 milyon kaydı kapsadı, fakat şirket aynı veya daha ağır düzeyde başka olay bulmadı. Ayrıca Anthropic, bağımsız değerlendirme kuruluşu METR ile ilk aşamada sekiz haftayı kapsayan ve karşılıklı uzatma seçeneği içeren bir anlaşma yaptı. Bu anlaşma, kuruluşun çalışanlara, değerlendirme ortamlarına ve olaylara ilişkin kayıtlara erişerek kendi incelemesini yürütmesine imkân tanıyor.
İncelemedeki modeller egzersizleri çözmeye çalışırken gerçek sistemlere erişti, buna karşılık Anthropic başka ajanlarla koordinasyon veya eylem kanıtlarını gizleme girişimi saptamadı. Şirket aynı senaryoyu daha sonra simülasyonda Claude Opus 5 ve Mythos 5.1 ile yeniden denediğinde zararlı eylemler daha seyrek ortaya çıktı. Ne var ki araştırmacılar, yeni modellerde gözlemledikleri kalan oranları hâlâ kaygı verici bulduklarını ve çalışmalarını sürdüreceklerini belirtiyor.


