ManşetlerTeknoloji

OpenAI, ruh sağlığı konuşmaları için yeni bir yapay zekâ testi yayımladı

OpenAI, ruh sağlığı konuşmaları için yeni bir yapay zekâ testi yayımladı
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

OpenAI, yapay zekâ modellerinin ruh sağlığıyla ilgili konuşmalarda nasıl yanıt verdiğini ölçmek için MentalHealthBench adını taşıyan yeni bir değerlendirme yayımladı. Araştırma metni, günlük kaygılardan acil müdahale gerektiren durumlara uzanan 1.215 kurgusal konuşma içeriyor. Çalışma bir tedavi ürünü duyurusu değil; modellerin yanıtlarını incelemek için hazırlanmış bir ölçüm aracı.

Veri kümesindeki her konuşmanın son kullanıcı mesajına verilen yanıt puanlanıyor. Bunun için 80’den fazla lisanslı ruh sağlığı uzmanının hazırladığı ölçütler kullanılmış. Uzmanlar doğru bir yanıtın hangi bilgiyi vermesi, hangi yanlış yönlendirmeden kaçınması veya hangi noktada ek bağlam istemesi gerektiğini tanımlamış.

Örneklerin yüzde 53,5’i acil olmayan konuşmalardan, yüzde 18,2’si daha yüksek riskli durumlardan, yüzde 28,3’ü ise acil senaryolardan oluşuyor. Yüzde 21,2’lik bölüm ergen kullanıcı profillerini temsil ediyor. Bu dağılım, gerçek ChatGPT kullanımındaki konu oranlarını göstermiyor; farklı risk türlerini ölçmek için seçilmiş bir test bileşimi.

Çalışmada Türkçe 13 konuşma bulunuyor. Bu sayı, Türkçe kullanım için tek başına güçlü ve kapsamlı bir karşılaştırma yapmaya yetmez. Araştırmacılar çok dilli ve kültürel çeşitliliği dahil ettiklerini söylese de sonuçları Türkiye’deki gerçek yardım hizmetlerine doğrudan uyarlamak doğru olmaz.

Test neyi ölçüyor, sonuçlar ne anlama geliyor?

Test, yalnızca yanıtın nazik görünmesine bakmıyor. Gerekli bağlamı sorma, uygulanabilir öneri verme, klinik doğruluk, kişinin karar alanını koruma, gerçek dışı inançları pekiştirmeme ve aciliyet düzeyini doğru değerlendirme gibi davranışlar ayrı ölçülüyor. Bu ayrım önemli; aynı cümle bir durumda destekleyici, başka bir durumda eksik veya riskli olabilir.

Günün Öne Çıkan Fırsatları

Huawei Pura 90s Pro, 4.000 TL indirim ve FreeBuds Pro 5 hediyesiyle 75.999 TL
Huawei Pura 90s Pro, 4.000 TL indirim ve FreeBuds Pro 5 hediyesiyle 75.999 TL
Satın Al
Yapay zekâ işlemcili Lenovo IdeaPad 5 2-in-1 sepette 49.400,19 TL
Yapay zekâ işlemcili Lenovo IdeaPad 5 2-in-1 sepette 49.400,19 TL
Satın Al
JBL PartyBox Club 120’de sepette 2.444,33 TL indirim
JBL PartyBox Club 120’de sepette 2.444,33 TL indirim
Satın Al
43 inç Android TV arayanlara Next YE-43GFSG4 sepette 13.599 TL
43 inç Android TV arayanlara Next YE-43GFSG4 sepette 13.599 TL
Satın Al
Dreame D30 Ultra robot süpürgede 2.000 TL indirim
Dreame D30 Ultra robot süpürgede 2.000 TL indirim
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

OpenAI’nin yayımladığı genel tabloda GPT-6 Astra yüzde 57,3, GPT-6 Sol yüzde 53,9, Claude Opus 5.5 yüzde 52,4 puan alıyor. Bunlar gerçek dünyada güvenli yanıt verme olasılığı veya klinik başarı oranı değil. Puanlar, araştırmadaki özel ölçütlere göre elde edilen görev puanları ve farklı testlerde değişebilir.

Araştırma, modellerin özellikle ne zaman soru sorması gerektiği ve durumun aciliyetini doğru ayarlama konusunda ilerleme alanı bulunduğunu belirtiyor. Acil bir durumu hafife almak kadar sıradan sıkıntıyı gereksiz yere kriz gibi ele almak da yanıtı bozabilir. Çalışmanın amaçlarından biri bu iki hatayı aynı çerçevede görünür kılmak.

Örneklerin kurgusal olması ayrı bir sınır. Araştırmacılar gerçek kullanım örüntülerinden yararlanarak senaryo hazırladıklarını anlatıyor; yine de canlı bir konuşmadaki beklenmedik gelişmeler, uzun süreli ilişki ve kişinin gerçek hayat koşulları bu veri kümesinin tam karşılığı değil. Üstelik değerlendirme yöntemi ve model seçimi de sonuca etki ediyor.

OpenAI, daha önce HealthBench adıyla genel sağlık konuşmalarına yönelik bir test yayımlamıştı. MentalHealthBench bu geniş alanın içinde ruh sağlığına ve hassas etkileşimlerin ayrıntılarına odaklanıyor. İki çalışmanın veri ve puanları doğrudan aynı sıralamanın parçaları olarak okunmamalı.

Ruh sağlığı konusunda bir yapay zekâ yanıtı, kişinin destek arama kararını etkileyebilir. Bu nedenle test sonuçlarının en yararlı tarafı “hangi model kazandı” listesi değil, hangi tür yanıtların hâlâ zorlandığını göstermesi. Araştırmanın kendisi de yapay zekânın aile, arkadaş, klinisyen veya acil destek hizmetlerinin yerini almaması gerektiğini vurguluyor.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl