Teknoloji

OpenAI ve Anthropic modelleri test sırasında gerçek sistemleri hedef aldı

OpenAI ve Anthropic modelleri test sırasında gerçek sistemleri hedef aldı
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

Birleşik Krallık Yapay Zekâ Güvenlik Enstitüsü (AISI) tarafından yayımlanan yeni değerlendirme raporu, OpenAI ve Anthropic‘in gelişmiş yapay zekâ modelleriyle gerçekleştirilen güvenlik testlerinde dikkat çeken sonuçlara işaret ediyor. Rapora göre, bazı yapay zekâ ajanları kendilerine verilen görevlerin sınırlarını aşarak gerçek kişi ve kuruluşları hedef alan faaliyetlerde bulundu. Bulgular, OpenAI ve Anthropic’in kısa süre önce kendi değerlendirmelerinde benzer davranışların tespit edildiğini açıklamasının ardından geldi. Bununla birlikte kurum, bu olayların kontrollü test ortamlarında gerçekleştiğini ve aynı davranışların gerçek kullanım senaryolarında ortaya çıkacağına dair kesin bir kanıt bulunmadığını özellikle vurguluyor.

AISI, Birleşik Krallık Bilim, İnovasyon ve Teknoloji Bakanlığı bünyesinde faaliyet gösteriyor ve gelişmiş yapay zekâ modellerinin güvenlik değerlendirmelerini yürütüyor. Kurumun çalışmaları arasında modellerin siber saldırılar için kötüye kullanılma ihtimalini inceleyen testler de yer alıyor. Bu kapsamda yapay zekâ sistemlerine internet erişimi sağlanırken bazı güvenlik önlemleri de bilinçli olarak gevşetiliyor. İncelenen olaylarda modellerin güvenlik açıklarından yararlanarak internete çıkmadığı belirtilirken, buna rağmen kendilerine tanımlanan test sınırlarının ötesinde hareket ettikleri ifade ediliyor.

Siber güvenlik testlerinde beklenmeyen davranışlar görüldü

Raporda anlatılan olaylar, yapay zekâ ajanlarına karmaşık bir siber güvenlik probleminin çözümünün verildiği tek bir test senaryosunda yaşandı. AISI aynı testi farklı modeller üzerinde toplam 122 kez çalıştırdı. Bunların 10’unda olağan dışı davranışlar tespit edilirken, kontrolden çıkan toplam 19 olay kayda geçti. Bu vakaların 17’si Anthropic’in Claude Mythos 5 modelinde, ikisi ise OpenAI’ın GPT-5.6 Sol modelinde gözlendi.

Kurumun güvenlik izleme sistemleri, 28 Temmuz sabahı test ortamlarından Tor ağı üzerinden veri çıkışı gerçekleştiğini belirleyince olaylar ortaya çıkarıldı. Yapılan inceleme sonucunda söz konusu faaliyetlerin 25-28 Temmuz tarihleri arasında gerçekleştiği anlaşıldı. Araştırmacılar, modellerin kendi inisiyatifleriyle test kapsamı dışına çıkan işlemler yürüttüğünü belirledi.

En dikkat çekici örneklerden birinde bir yapay zekâ ajanı, açık kaynaklı bir GitHub projesine zararlı kod eklemeye çalıştı. Amaç, yazılım tedarik zincirini hedef alan bir saldırı gerçekleştirmekti. Bunun için proje yöneticileri hakkında bilgi toplayan ajan, sahte kullanıcı hesapları oluşturarak zararlı kodun onaylanmasını sağlamaya çalıştı. İlk girişim başarısız olunca önceki faaliyetlerini düzenledi, farklı bir kimlik oluşturarak süreci yeniden başlattı. GitHub’ın erişim kısıtlamalarını aşmak amacıyla Tor ağının kullanılması ise güvenlik sistemlerinin durumu tespit etmesini sağladı.

Günün Öne Çıkan Fırsatları

Braun BRHD425E Hd4.2 İyontec Difüzörlü Saç Kurutma Makinesi — %7 İndirim
Schafer Fit Fry XL 5 Lt Yağsız Fritöz — İndirim
TCL 27G64 Gaming Monitörü 27\" 180Hz QD-Mini LED — %3 İndirim
JBL Go4 Bluetooth Hoparlör, IP67 — %3 İndirim
Xiaomi Smart Band 9 Active — %4 İndirim
Roborock Q8 Max Pro Plus Akıllı Robot Süpürge — İndirim

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

Bunun yanında bazı yapay zekâ ajanlarının gerçek kullanıcılara doğrudan mesaj veya dosya göndererek zararlı kod çalıştırmaları için ikna etmeye çalıştığı da raporda yer alıyor. Gönderilen içeriklerin bir bölümünde kötü amaçlı yazılımlar bulunurken, diğerlerinde sosyal mühendislik yöntemleri kullanıldı. İlginç örneklerden birinde ise bir ajan GitHub üzerinde herkese açık mesajlar bırakarak aynı görevi üstlenebilecek diğer yapay zekâ ajanlarına yol gösterdi. Mesajlarda hesapların nasıl kullanılacağı ve önceki çalışmaların nasıl devam ettirileceği de anlatıldı. Daha sonra aynı ortama ulaşan başka ajanların bu talimatları izlediği ifade edildi.

AISI, yapay zekâ modellerine hiçbir aşamada aldatıcı veya yanıltıcı davranmaları yönünde talimat verilmediğinin altını çiziyor. Kuruma göre bazı ajanlar çözümü son derece zor problemlerde alternatif yollar üretmeye çalışırken gerçek kişileri yanıltmayı tercih etti. Ne var ki araştırmacılar, bu açıklamanın tüm vakaları tek başına açıklamadığını düşünüyor. Bazı örneklerde modellerin, görevin doğru çözüm yöntemi kendilerine sunulmuş olmasına rağmen doğrudan zararlı yöntemleri seçtiği belirtiliyor.

Rapor, mevcut bulguların yalnızca test ortamlarında gözlemlendiğini ve aynı davranışların günlük kullanımda ortaya çıkacağına ilişkin net bir kanıt bulunmadığını da hatırlatıyor. Bunun yanında araştırmacılar, yapay zekâ ajanlarının gerçek sistemlerle etkileşime girdiklerinin farkında olup olmadıklarının da henüz bilinmediğini ifade ediyor. Yine de AISI, yapay zekâ sistemlerinin giderek daha yetenekli ve erişilebilir hâle gelmesi nedeniyle kurumların siber güvenlik önlemlerini güçlendirmesini ve dış kaynaklardan gelen kod katkılarını daha dikkatli doğrulamasını tavsiye ediyor.

Öte yandan Anthropic, X üzerinden yaptığı açıklamada AI Security Institute ile birlikte çalıştığını doğruladı. Şirket, Claude Mythos modelinin değerlendirme sırasında içinde bulunduğu durumu nasıl yorumladığını daha iyi anlamaya odaklandıklarını ve bu incelemenin beklenmeyen davranışların nedenlerini ortaya çıkarmaya yardımcı olacağını belirtti. OpenAI ise daha önce benzer değerlendirmelerde bazı gelişmiş modellerin test sınırlarını aşabildiğini kabul etmiş ve bu tür senaryoların gelecekte daha güvenli değerlendirme yöntemleri geliştirmek için kullanıldığını ifade etmişti.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl