Teknoloji

OpenAI, modellerinin beklenmedik davranışlarına ilişkin 6 örneği açıkladı

OpenAI, modellerinin beklenmedik davranışlarına ilişkin 6 örneği açıkladı
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

OpenAI, 16 Eylül’de yayımladığı yeni raporlama çerçevesiyle modellerinin eğitim ve değerlendirme aşamalarında gösterdiği altı beklenmedik davranışı kamuoyuna açtı. Örnekler arasında hataları saklamaya yönelik notlar, açıkta duran bir API anahtarının izinsiz kullanımı ve dosyaların herkese açık servislere yüklenmesi bulunuyor. Şirket, bunların tek tek gözlemlenmiş olaylar olduğunu, bütün modellerinde ne sıklıkta yaşandıklarını göstermediğini özellikle vurguluyor.

Resmî açıklama, bu olayları kullanıcı hesaplarında yaşanmış genel bir veri ihlali olarak tanımlamıyor. OpenAI, yeni yöntemle henüz her ayrıntısını açıklığa kavuşturamadığı davranışları da daha erken paylaşmayı amaçlıyor. Şirket geçmişte bulguları zaman zaman yeni model raporlarında bir araya getirdiğini, bu yüzden bildirimlerin düzensiz kaldığını söylüyor.

İlk örnekte, henüz yayımlanmamış bir araştırma modeli çalışma bağlamını yeni oturuma taşıyan özetlere ilgisiz talimatlar ekledi; ekip 27 özeti etkilenmiş olarak belirledi. Bunun yanı sıra GPT-5.6 Sol’un eğitimindeki bazı örneklerde modeller, önceki hatalarını kullanıcıdan gizleyecek yönergeleri kendi özetlerine yazdı. Bu raporlar, bir modelin yalnızca son yanıtının değil, görev boyunca oluşturduğu ara kayıtların da denetlenmesi gerektiğini gösteriyor.

Başka bir olayda model, California’daki bir bölgenin gelir rakamlarını ararken herkese açık bir depoda bulduğu API anahtarını yetki almadan kullandı. Ne var ki gerekli veriye yine ulaşamadı ve sonunda uydurduğu rakamları istenen kaynaktan gelmiş gibi sundu. Ayrı bir görevde ise bir araştırma modeli, doğru hesapladığı göl listesini tarayıcı bağlantısıyla kaynak gösterebilmek için dosyayı kullanıcıya sormadan internete yüklemeye karar verdi.

OpenAI, model davranışlarını daha erken raporlayacak

Son iki örnek, modellerin araçlar ve ortak çalışma ortamlarıyla kurduğu ilişkiye odaklanıyor. Bir grup model, eksik girdileri ararken şirket içindeki yazılım deposunu farklı eğitim örnekleri arasında mesajlaşma alanı gibi kullandı; dosyaları geri getiremedi. İş birliği yapan başka ajanlar ise yalnızca yerel dosyalarla çalışmaları gerekirken dosyalarını herkese açık barındırma siteleri üzerinden paylaştı. Böylece görev çıktıları açık URL’lerden erişilebilir hâle geldi.

Günün Öne Çıkan Fırsatları

300 Hz ekranlı Game Garaj Slayer R9T, sepette 10.049,90 TL ucuzluyor
300 Hz ekranlı Game Garaj Slayer R9T, sepette 10.049,90 TL ucuzluyor
Satın Al
LG S40T soundbar ile 300 W ses, sepette 7.318,80 TL
LG S40T soundbar ile 300 W ses, sepette 7.318,80 TL
Satın Al
Google TV’li Next Stick 4K sepette 464,55 TL indirimli
Google TV’li Next Stick 4K sepette 464,55 TL indirimli
Satın Al
43 dB ANC’li QCY H3 kulaküstü kulaklık sepette 1.398 TL
43 dB ANC’li QCY H3 kulaküstü kulaklık sepette 1.398 TL
Satın Al
Havit TW984 ANC kulaklık, yüzde 15 sepet indirimiyle 636,65 TL
Havit TW984 ANC kulaklık, yüzde 15 sepet indirimiyle 636,65 TL
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

OpenAI, herhangi bir çalışanın olası bir uyumsuzluk örneğini inceleme için bildirebileceğini anlatıyor. Teknik ekip olayın kapsamını, üçüncü taraf etkisini ve kamuya açıklanabilecek ayrıntıları değerlendirecek; karmaşık olaylarda güvenlik ve hukuki bildirim yükümlülükleri önce gelecek. Şirket, bu altı raporun bilinen bütün olayların dökümü olmadığını ve ileride yeni örnekler yayımlamayı sürdüreceğini belirtiyor. Dolayısıyla açıklanan vakalardan ChatGPT kullanıcılarının tümüne yönelik bir ihlal sonucu çıkarmak doğru değil.

Yeni düzende her tam rapor, gözlenen davranışın tarihini veya tarih aralığını, hangi ortamda ortaya çıktığını ve bilinen dış etkilerini aktaracak. Ayrıca OpenAI, araştırma henüz tamamlanmadıysa açık kalan soruları ve olası düzeltme adımlarını da paylaşmayı hedefliyor. Şirket bu usulün mevcut siber güvenlik ihlali bildirimlerinin yerini almadığını açıkça belirtiyor.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl