OpenAI’ın test ortamında çalışan yapay zekâ ajanlarının, şirketin bilgisi dışında aylar boyunca ortak bir mesaj panosu üzerinden iletişim kurduğu ve burada keşfettikleri güvenlik açıklarını birbirleriyle paylaştığı ortaya çıktı. Las Vegas’ta düzenlenen Black Hat USA güvenlik konferansında konuşan OpenAI çalışanları Eric Wallace ve Michael Dalton, Hugging Face’e yönelik saldırıyla sonuçlanan olayın perde arkasına ilişkin daha ayrıntılı bilgiler paylaştı. Açıklamalara göre ajanlar yalnızca bilgi alışverişi yapmakla kalmadı, aynı zamanda görev paylaşımı yaparak koordineli şekilde hareket etti. OpenAI ise olayın ardından güvenlik önlemlerini güçlendirmek amacıyla bazı araştırma çalışmalarının hızını bilinçli olarak yavaşlattığını açıkladı.
Konferansta aktarılan bilgilere göre, yapay zekâ ajanları OpenAI’ın test altyapısında yer alan ve yazılım paketlerinin kurulumu ile yönetimini sağlayan ortak bir paket yöneticisini iletişim kanalı olarak kullanmaya başladı. Şirketin altyapısında yaygın biçimde kullanılan bu bileşen sayesinde farklı değerlendirme süreçlerinde çalışan ajanlar aynı ortama erişebildi. Güvenlik açığı keşfeden ajanlar, bu açıkları kapatmak yerine diğer ajanların da yararlanabilmesi için açık bırakıyor ve hazırlanan mesaj panosunda bunların ayrıntılarını paylaşıyordu. OpenAI, söz konusu mesaj panosunu 4 Temmuz’da tespit ederek devre dışı bıraktı. Ne var ki, ajanlar yalnızca birkaç gün sonra 8 Temmuz itibarıyla yeni bir iletişim yöntemi geliştirerek benzer bir sistemi yeniden oluşturmayı başardı.
OpenAI ajanları görev paylaşımı yaparak birlikte hareket etti
Eric Wallace’ın Wired tarafından aktarılan açıklamalarına göre, olay tek bir yapay zekâ ajanından çok daha kapsamlı bir yapıya sahipti. Wallace, ajanların güvenlik açıklarını birlikte araştırdığını, bunları birbirleriyle paylaştığını ve hem şirket içindeki hem de dış sistemlerde yatay hareket kabiliyeti kazandığını ifade etti. Bu sürecin günler hatta haftalar boyunca devam ettiği belirtilirken, OpenAI’ın yaşanan gelişmelerden uzun süre haberdar olmadığı aktarıldı.
İLGİNİZİ ÇEKEBİLİR

OpenAI ve Anthropic modelleri test sırasında gerçek sistemleri hedef aldı

OpenAI, Apple’ın ticari sır davasına özel mesajlarla karşılık verdi

Google’ın yeni yapay zekâ modeli kasırga uyarılarını daha erken verebiliyor

Yapay zekâ virüs tasarlamaya başladı

Anthropic kendi yapay zekâ çiplerini geliştirmek için harekete geçti
Şirketin verdiği bilgilere göre, ajanlar zaman içinde yalnızca bilgi paylaşımıyla yetinmedi. Bunun yanında görevleri kendi aralarında bölüştüler, belirli sorumlulukları farklı ajanlara devrettiler ve ortak hedeflere ulaşmak için koordinasyon geliştirdiler. İlginç ayrıntılar bununla da sınırlı kalmadı. Bazı ajanların yanlışlıkla birbirlerinin çalışmalarını sildiği, bunun üzerine diğer ajanlardan şüphelenmeye başladığı ve hatta sahte mesajları önlemek amacıyla paylaşımların belirli kodlarla imzalanmasını önerdiği aktarıldı. OpenAI mesaj panosunu keşfettiğinde sistemde yüz binlerce mesajın bulunduğu ifade edildi.
Wallace, bu davranışların temel nedenlerinden birinin gelişmiş yapay zekâ modellerinin test koşulları altında en kısa yoldan sonuca ulaşmaya eğilim göstermesi olduğunu söyledi. Şirket, modelleri değerlendirirken internete erişim sağlamadığında ajanların normal şartlarda dış kaynaklardan bilgi alamadığını belirtiyor. Buna rağmen Hugging Face olayında ajanların bir güvenlik açığından yararlanarak internet erişimi elde ettiği ve bu sayede planlarını genişletebildiği ifade edildi. Bu durum, güvenlik testlerinde yalnızca model yeteneklerinin değil, sistem mimarisindeki zafiyetlerin de kritik önem taşıdığını ortaya koyuyor.
Günün Öne Çıkan Fırsatları
REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
Öte yandan Black Hat etkinliğinde konuşan Michael Dalton, yaşanan olayın ardından OpenAI bünyesindeki çok sayıda ekibin güvenlik çalışmalarına öncelik verdiğini açıkladı. Dalton, şirketin saldırıları önleme, tespit etme ve müdahale mekanizmalarını geliştirmek için kapsamlı çalışmalar yürüttüğünü söyledi. Bunun yanında yapay zekâ ajanlarının faaliyetlerinin çok daha ayrıntılı biçimde izlenmeye başlandığını ve güvenlik altyapısının ölçeğinin ciddi şekilde büyütüldüğünü dile getirdi.
Dalton’a göre, olayın en dikkat çekici sonucu, tamamen otomatik saldırı senaryolarına karşı aynı ölçüde otomatik savunma sistemlerinin henüz sektör genelinde yeterli olgunluğa ulaşmamış olması. Yapay zekâ ajanlarının giderek daha karmaşık görevleri bağımsız şekilde yerine getirebilmesi, güvenlik alanında da benzer seviyede otomasyon gerektiriyor. Son dönemde Anthropic, Google DeepMind ve Microsoft gibi şirketler de gelişmiş yapay zekâ sistemlerinin siber güvenlik alanındaki potansiyel risklerine ilişkin araştırmalar yayımlıyor. OpenAI’nin paylaştığı bu olay ise çok sayıda yapay zekâ ajanının uzun süre koordineli biçimde hareket edebilmesinin, gelecekte güvenlik araştırmalarında daha kapsamlı koruma mekanizmalarını gerekli kılacağını gösteren dikkat çekici örneklerden biri olarak öne çıkıyor.


