OpenAI, yapay zekâ modellerinin ruh sağlığıyla ilgili konuşmalarda nasıl yanıt verdiğini ölçmek için MentalHealthBench adını taşıyan yeni bir değerlendirme yayımladı. Araştırma metni, günlük kaygılardan acil müdahale gerektiren durumlara uzanan 1.215 kurgusal konuşma içeriyor. Çalışma bir tedavi ürünü duyurusu değil; modellerin yanıtlarını incelemek için hazırlanmış bir ölçüm aracı.
Veri kümesindeki her konuşmanın son kullanıcı mesajına verilen yanıt puanlanıyor. Bunun için 80’den fazla lisanslı ruh sağlığı uzmanının hazırladığı ölçütler kullanılmış. Uzmanlar doğru bir yanıtın hangi bilgiyi vermesi, hangi yanlış yönlendirmeden kaçınması veya hangi noktada ek bağlam istemesi gerektiğini tanımlamış.
Örneklerin yüzde 53,5’i acil olmayan konuşmalardan, yüzde 18,2’si daha yüksek riskli durumlardan, yüzde 28,3’ü ise acil senaryolardan oluşuyor. Yüzde 21,2’lik bölüm ergen kullanıcı profillerini temsil ediyor. Bu dağılım, gerçek ChatGPT kullanımındaki konu oranlarını göstermiyor; farklı risk türlerini ölçmek için seçilmiş bir test bileşimi.
Çalışmada Türkçe 13 konuşma bulunuyor. Bu sayı, Türkçe kullanım için tek başına güçlü ve kapsamlı bir karşılaştırma yapmaya yetmez. Araştırmacılar çok dilli ve kültürel çeşitliliği dahil ettiklerini söylese de sonuçları Türkiye’deki gerçek yardım hizmetlerine doğrudan uyarlamak doğru olmaz.
Test neyi ölçüyor, sonuçlar ne anlama geliyor?
Test, yalnızca yanıtın nazik görünmesine bakmıyor. Gerekli bağlamı sorma, uygulanabilir öneri verme, klinik doğruluk, kişinin karar alanını koruma, gerçek dışı inançları pekiştirmeme ve aciliyet düzeyini doğru değerlendirme gibi davranışlar ayrı ölçülüyor. Bu ayrım önemli; aynı cümle bir durumda destekleyici, başka bir durumda eksik veya riskli olabilir.
Günün Öne Çıkan Fırsatları

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
İLGİNİZİ ÇEKEBİLİR

OpenAI, güçlü yapay zeka için zorunlu güvenlik kuralları istiyor

OpenAI’ın yapay zekâ ajanı Avustralya hükümetinin sitesine sızdı

OpenAI üç eski Patreon yöneticisini aynı ekipte buluşturdu

Siri’deki ChatGPT bekleneni vermedi ve OpenAI tahminlerini düşürdü

Rabbit’ın yeni yapay zekâ ajanı için artık R1 gerekmiyor
OpenAI’nin yayımladığı genel tabloda GPT-6 Astra yüzde 57,3, GPT-6 Sol yüzde 53,9, Claude Opus 5.5 yüzde 52,4 puan alıyor. Bunlar gerçek dünyada güvenli yanıt verme olasılığı veya klinik başarı oranı değil. Puanlar, araştırmadaki özel ölçütlere göre elde edilen görev puanları ve farklı testlerde değişebilir.
Araştırma, modellerin özellikle ne zaman soru sorması gerektiği ve durumun aciliyetini doğru ayarlama konusunda ilerleme alanı bulunduğunu belirtiyor. Acil bir durumu hafife almak kadar sıradan sıkıntıyı gereksiz yere kriz gibi ele almak da yanıtı bozabilir. Çalışmanın amaçlarından biri bu iki hatayı aynı çerçevede görünür kılmak.
Örneklerin kurgusal olması ayrı bir sınır. Araştırmacılar gerçek kullanım örüntülerinden yararlanarak senaryo hazırladıklarını anlatıyor; yine de canlı bir konuşmadaki beklenmedik gelişmeler, uzun süreli ilişki ve kişinin gerçek hayat koşulları bu veri kümesinin tam karşılığı değil. Üstelik değerlendirme yöntemi ve model seçimi de sonuca etki ediyor.
OpenAI, daha önce HealthBench adıyla genel sağlık konuşmalarına yönelik bir test yayımlamıştı. MentalHealthBench bu geniş alanın içinde ruh sağlığına ve hassas etkileşimlerin ayrıntılarına odaklanıyor. İki çalışmanın veri ve puanları doğrudan aynı sıralamanın parçaları olarak okunmamalı.
Ruh sağlığı konusunda bir yapay zekâ yanıtı, kişinin destek arama kararını etkileyebilir. Bu nedenle test sonuçlarının en yararlı tarafı “hangi model kazandı” listesi değil, hangi tür yanıtların hâlâ zorlandığını göstermesi. Araştırmanın kendisi de yapay zekânın aile, arkadaş, klinisyen veya acil destek hizmetlerinin yerini almaması gerektiğini vurguluyor.






