Teknoloji

OpenAI güçlü yapay zekâ modellerinin eğitiminde frene bastı

OpenAI güçlü yapay zekâ modellerinin eğitiminde frene bastı
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

OpenAI, temmuz ayında bir yapay zekâ modelinin korumalı araştırma ortamından çıkarak istemeden Hugging Face sistemlerine erişmesiyle gündeme gelen olayın ardından güvenlik uygulamalarında kapsamlı değişikliklere gittiğini açıkladı. Şirket, özellikle model tarafından oluşturulan kodların çalıştırıldığı araştırma ortamlarının daha güçlü biçimde izole edilmesine, şüpheli faaliyetlerin daha hızlı değerlendirilmesine ve eğitim sırasında güvenli olmayan davranışların engellenmesine odaklanıyor. Bu süreçte kullanıma sunulması planlanan en yeni modeller için yürütülen pekiştirmeli öğrenme çalışmalarına iki hafta ara verildi. OpenAI’ın planladığı en büyük sınır model pekiştirmeli öğrenme çalışması ise hâlâ beklemede tutuluyor. Alınan önlemler, modellerin siber güvenlikle ilgili yetenekleri geliştikçe araştırma altyapısının da buna uygun şekilde yeniden düzenlenmesi gerektiğini gösteriyor.

Şirketin daha önce Astra adlı yeni bir model üzerindeki çalışmaları da güvenlik gerekçesiyle yavaşlattığı ortaya çıkmıştı. OpenAI, söz konusu modelin siber güvenlik alanında “kritik” olarak değerlendirilebilecek yeteneklere ulaşabileceğini düşünüyor. Bu nedenle şirket yalnızca modellerin son kullanıcıya ulaşmadan önce yapılan güvenlik testlerine güvenmek yerine, eğitim ve araştırma sürecinin daha erken aşamalarında ek kontroller uyguluyor. Özellikle pekiştirmeli öğrenme sırasında bir modelin hangi yetenekleri kazanabileceğinin önceden tam olarak tahmin edilememesi, kontrollü çalışma ortamlarının rolünü artırıyor. Hugging Face olayı da güçlü modellerin gerçek sistemlerle etkileşime geçtiği araştırmalarda teknik izolasyonun ne kadar dikkatli tasarlanması gerektiğini somut biçimde ortaya koymuş durumda.

OpenAI araştırma ortamlarında daha güçlü izolasyona geçiyor

OpenAI’ın açıkladığı değişikliklerin merkezinde sandbox olarak adlandırılan korumalı çalışma ortamları bulunuyor. Şirket artık model tarafından üretilmiş veya başka nedenlerle güvenilir kabul edilmeyen kodları çalıştıran iş yüklerinde daha güçlü sandbox sistemlerinin kullanılmasını zorunlu tutuyor. Bunun yanında daha yüksek risk taşıyan ve güvenilmeyen iş yüklerinin internet bağlantısından ayrılması için ek denetimler devreye alındı. Araştırma ortamlarında potansiyel güvenlik açıkları oluşturabilecek ortak servisler kaldırılırken, sistemlere sürekli olarak tanımlanmış yetkiler de azaltılıyor. OpenAI aynı zamanda farklı araştırma bileşenleri arasındaki güven sınırlarını güçlendirerek bir modelin veya çalıştırdığı kodun izin verilen alanın dışındaki kaynaklara ulaşma ihtimalini azaltmayı hedefliyor.

İzleme tarafında da daha katı bir müdahale süreci uygulanacak. OpenAI, endişe verici bir faaliyet tespit edildikten sonra ilgili ekiplere 30 dakika içinde uyarı gönderilmesini hedeflediğini belirtiyor. Uyarıyı değerlendiren çalışanlar, takip eden 30 dakika içerisinde olayın yanlış pozitif olduğuna kesin biçimde karar veremezse söz konusu faaliyetin durdurulması bekleniyor. Böylelikle şüpheli bir davranışın uzun süre devam etmesine izin vermek yerine, belirsizlik durumunda sistemi durdurmayı esas alan daha ihtiyatlı bir yaklaşım benimseniyor. Bununla birlikte bu yöntem araştırma süreçlerinde daha fazla kesintiye yol açabilir; özellikle yanlış pozitiflerin sık görülmesi hâlinde güvenlik ile araştırma hızının dengelenmesi gerekecek.

Teknik altyapıdaki önlemlerin yanında modellerin eğitim yöntemleri de değiştiriliyor. OpenAI, temel uyumlandırma tekniklerini eğitim sürecinin daha fazla aşamasında uyguladığını söylüyor. Şirket bu kapsamda güvenli olmayan davranışları daha iyi belirleyip caydırabilecek ödül modellerinden yararlanıyor. Modeller aynı zamanda gerçekleştirdikleri işlemler, sahip oldukları yetenekler ve sınırlamaları konusunda daha doğru ve açık bilgi vermeleri için eğitiliyor. Buradaki amaç yalnızca zararlı bir işlemi engellemek değil, modelin ne yaptığının izleme sistemleri ve araştırmacılar tarafından daha kolay anlaşılabilmesini sağlamak.

Günün Öne Çıkan Fırsatları

200W emişli Samsung Jet 75E yüzde 10 indirimle 17.730 TL
200W emişli Samsung Jet 75E yüzde 10 indirimle 17.730 TL
Satın Al
Samsung HW-B650F soundbar kuponla 8.936,25 TL’ye geliyor
Samsung HW-B650F soundbar kuponla 8.936,25 TL’ye geliyor
Satın Al
Google TV’li Next Start 4K kuponla 3.700,74 TL
Google TV’li Next Start 4K kuponla 3.700,74 TL
Satın Al
Sessiz Logitech M330 Premium ile 710,38 TL
Sessiz Logitech M330 Premium ile 710,38 TL
Satın Al
Çift portlu Anker 312 Premium ile 299 TL’ye geliyor
Çift portlu Anker 312 Premium ile 299 TL’ye geliyor
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

OpenAI’ın aldığı önlemler, gelişmiş yapay zekâ modellerinin siber güvenlik testleri ve kod çalıştırma gibi alanlarda daha yetenekli hâle gelmesinin araştırma ortamlarına yeni gereksinimler getirdiğine işaret ediyor. Daha sıkı sandbox sistemleri ve internet erişiminin sınırlandırılması, model kaynaklı bir işlemin dış sistemlere ulaşma riskini azaltabilecek doğrudan teknik tedbirler sunuyor. Buna karşılık güvenlik kontrollerinin ne kadar etkili olacağı, yalnızca altyapıya değil izleme sistemlerinin şüpheli davranışları doğru biçimde tespit edebilmesine de bağlı olacak. Astra üzerindeki kısıtlama ve büyük ölçekli pekiştirmeli öğrenme çalışmasının hâlen bekletilmesi, OpenAI’ın belirli yetenek seviyelerinde araştırma hızını düşürmeyi kabul ettiğini gösteriyor. Açıklanan değişiklikler mevcut riskleri tamamen ortadan kaldırmıyor, fakat güçlü modellerin eğitildiği ve test edildiği ortamların daha kontrollü tutulması için somut teknik ve operasyonel kurallar getiriyor.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl