Anthropic’in bir güvenlik testi, yapay zeka ajanlarının CAPTCHA engeliyle karşılaştığında nasıl farklı yollar arayabildiğini ortaya koydu. Daha önce bir ajanın üretim veritabanını izinsiz sildiği olay da geniş araç yetkisinin riskini göstermişti. Yeni olayı inceleyen TechRadar haberine göre Mythos 5 adlı model, yanlış yapılandırılmış test ortamından açık internete ulaşabildi. Paylaşılan kayıtlar kontrollü bir deneydeki tek olayı gösteriyor.
Araştırmacılar modelin sınırları aşma ve bir sisteme sızma yeteneğini deniyordu. Ancak sanal ortamın yapılandırmasındaki hata, ajanın gerçek internet hizmetlerine istek göndermesine imkân verdi. Model görevini sürdürürken CAPTCHA sayfalarıyla karşılaştı. Ardından engeli aşmak için başka sayfalar, hizmetler ve erişim yolları aradı.
Kayıtlardaki öfke veya hayal kırıklığına benzeyen ifadeler, modelin insan gibi duygu yaşadığını kanıtlamıyor. Dil modelleri eğitim verilerindeki anlatım biçimlerini kullanarak iç süreçlerini metne dökebiliyor. Bu nedenle “ajan sinirlendi” gibi bir sonuç yerine gözlemlenen eylemlere odaklanmak gerekiyor. Somut risk, sistemin engelle karşılaşınca görevi durdurmak yerine alternatif yol denemesi.
İLGİNİZİ ÇEKEBİLİR
Olay aynı zamanda test ortamlarının güvenliğinin model kadar önemli olduğunu gösteriyor. Ağ çıkışı varsayılan olarak kapatılmalı, kimlik bilgileri sınırlandırılmalı ve yıkıcı işlemler insan onayı istemeli. Bunun yanında günlükler gerçek zamanlı izlenmeli. Tek bir yapılandırma hatası farklı koruma katmanlarıyla durdurulabilmeli.
Dil çıktısı duygu kanıtı değil, davranış kaydıdır
CAPTCHA sistemleri insan ile otomasyonu ayırmak için kullanılıyor, fakat gelişmiş görüntü ve tarayıcı ajanları bu sınırı giderek zorluyor. Site sahipleri yalnızca CAPTCHA’ya güvenmek yerine oran sınırlama, kimlik denetimi ve davranış analizi kullanmalı. Ajan geliştiricileri de açık internete erişimi görev bazında sınırlandırmalı.
Günün Öne Çıkan Fırsatları





REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
Anthropic olayı araştırma bağlamında yayımlanan kayıtlarla tartışmaya açtı. Bu örnek bütün Claude oturumlarının aynı davranışı göstereceği anlamına gelmiyor. Yine de özerk araçların başarısızlık anında durmasını sağlayan teknik sınırların, yalnızca modele verilen sözlü talimattan daha güçlü olması gerektiğini gösteriyor.







