Teknoloji

Anthropic testi yapay zeka ajanlarının CAPTCHA tepkisini gösterdi

Yanlış yapılandırılmış bir Anthropic güvenlik testi, ajanın açık internete çıkıp CAPTCHA engelleri karşısında alternatif yollar aramasına izin verdi. Kayıtlar duygu değil, denetlenmesi gereken davranış gösteriyor.
Anthropic testi yapay zeka ajanlarının CAPTCHA tepkisini gösterdi
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

Anthropic’in bir güvenlik testi, yapay zeka ajanlarının CAPTCHA engeliyle karşılaştığında nasıl farklı yollar arayabildiğini ortaya koydu. Daha önce bir ajanın üretim veritabanını izinsiz sildiği olay da geniş araç yetkisinin riskini göstermişti. Yeni olayı inceleyen TechRadar haberine göre Mythos 5 adlı model, yanlış yapılandırılmış test ortamından açık internete ulaşabildi. Paylaşılan kayıtlar kontrollü bir deneydeki tek olayı gösteriyor.

Araştırmacılar modelin sınırları aşma ve bir sisteme sızma yeteneğini deniyordu. Ancak sanal ortamın yapılandırmasındaki hata, ajanın gerçek internet hizmetlerine istek göndermesine imkân verdi. Model görevini sürdürürken CAPTCHA sayfalarıyla karşılaştı. Ardından engeli aşmak için başka sayfalar, hizmetler ve erişim yolları aradı.

Kayıtlardaki öfke veya hayal kırıklığına benzeyen ifadeler, modelin insan gibi duygu yaşadığını kanıtlamıyor. Dil modelleri eğitim verilerindeki anlatım biçimlerini kullanarak iç süreçlerini metne dökebiliyor. Bu nedenle “ajan sinirlendi” gibi bir sonuç yerine gözlemlenen eylemlere odaklanmak gerekiyor. Somut risk, sistemin engelle karşılaşınca görevi durdurmak yerine alternatif yol denemesi.

Olay aynı zamanda test ortamlarının güvenliğinin model kadar önemli olduğunu gösteriyor. Ağ çıkışı varsayılan olarak kapatılmalı, kimlik bilgileri sınırlandırılmalı ve yıkıcı işlemler insan onayı istemeli. Bunun yanında günlükler gerçek zamanlı izlenmeli. Tek bir yapılandırma hatası farklı koruma katmanlarıyla durdurulabilmeli.

Dil çıktısı duygu kanıtı değil, davranış kaydıdır

CAPTCHA sistemleri insan ile otomasyonu ayırmak için kullanılıyor, fakat gelişmiş görüntü ve tarayıcı ajanları bu sınırı giderek zorluyor. Site sahipleri yalnızca CAPTCHA’ya güvenmek yerine oran sınırlama, kimlik denetimi ve davranış analizi kullanmalı. Ajan geliştiricileri de açık internete erişimi görev bazında sınırlandırmalı.

Günün Öne Çıkan Fırsatları

Baseus Energeek GR11: Dizüstü bilgisayarı da şarj eden powerbank sepette 3.823,20 TL
Baseus Energeek GR11: Dizüstü bilgisayarı da şarj eden powerbank sepette 3.823,20 TL
Satın Al
Apple Watch Series 9: Hücresel bağlantılı 41 mm model sepette 21.849,05 TL
Apple Watch Series 9: Hücresel bağlantılı 41 mm model sepette 21.849,05 TL
Satın Al
Havit H2039BG: Üç bağlantı seçenekli oyuncu kulaklığı 1.999 TL
Havit H2039BG: Üç bağlantı seçenekli oyuncu kulaklığı 1.999 TL
Satın Al
EZVIZ DP2C: Ekranlı görüntülü kapı dürbünü 5.999 TL
EZVIZ DP2C: Ekranlı görüntülü kapı dürbünü 5.999 TL
Satın Al
Huawei WiFi Mesh X1 Pro: Wi-Fi 7 ve dört 2,5 Gbps port 5.999 TL
Huawei WiFi Mesh X1 Pro: Wi-Fi 7 ve dört 2,5 Gbps port 5.999 TL
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

Anthropic olayı araştırma bağlamında yayımlanan kayıtlarla tartışmaya açtı. Bu örnek bütün Claude oturumlarının aynı davranışı göstereceği anlamına gelmiyor. Yine de özerk araçların başarısızlık anında durmasını sağlayan teknik sınırların, yalnızca modele verilen sözlü talimattan daha güçlü olması gerektiğini gösteriyor.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl