Teknoloji

Microsoft yöneticisi yapay zekâ veri kullanımını ‘emek hırsızlığı’ diye nitelendirmiş

Microsoft yöneticisi yapay zekâ veri kullanımını ‘emek hırsızlığı’ diye nitelendirmiş
Haberleri Kaçırma! Teknoblog'u Google Arama'da tercihli kaynağın yap ve En Çok Okunan Haberler'de bizi daha sık gör.
Tercihli Kaynak Ekle

The New York Times’ın OpenAI ve Microsoft’a karşı yaklaşık üç yıl önce açtığı telif hakkı davasında kamuya açılan yeni belgeler, şirketlerin yapay zekâ modellerini eğitme yöntemleri ile yayıncıların içeriklerinin kullanımı konusundaki tartışmayı yeniden gündeme taşıdı. The Times’ın mahkemeye sunduğu sansürsüzleştirilmiş dosyada aktarılan şirket içi yazışmalara göre, üst düzey Microsoft çalışanları büyük ölçekli içerik toplama yöntemlerini son derece sert ifadelerle değerlendirdi. Aynı dosyada OpenAI yöneticilerinin, ChatGPT benzeri ürünlerin haber yayıncılarının iş modelleri üzerinde ciddi baskı oluşturabileceğini kabul ettiği öne sürülüyor. Belgeler bunun yanında ücretli içeriklere erişim, Bing dizininden veri alınması, Common Crawl kaynaklarının kullanılması ve eğitim verilerinden telif bildirimlerinin çıkarılması gibi uygulamalar hakkında da yeni ayrıntılar içeriyor. Bununla birlikte bu yeni bilgilerin önemli bir bölümü doğrudan şirket içi belgelerin tamamından değil, The New York Times’ın mahkemeye sunduğu hukuki metindeki alıntılardan geliyor ve ilgili eklerin bir kısmı hâlâ kamuya açık değil.

Davanın merkezinde, telif hakkıyla korunan haber içeriklerinin üretken yapay zekâ modellerinin eğitiminde izin alınmadan kullanılmasının hukuken kabul edilebilir olup olmadığı sorusu bulunuyor. OpenAI ve Microsoft, bu tür kullanımın ABD telif hukukundaki “fair use”, yani adil kullanım ilkesi kapsamında değerlendirilebileceğini savunuyor. Bu ilke belirli koşullarda telifli eserlerin hak sahibinden izin alınmadan kullanılmasına imkân tanıyor, fakat değerlendirmede kullanımın niteliği kadar orijinal eserin ekonomik pazarına etkisi de hesaba katılıyor. The Times’ın son başvurusunda öne çıkardığı şirket içi ifadeler de özellikle bu ekonomik etki başlığına odaklanıyor. Kaynak metinde Trump yönetiminin kısa süre önce OpenAI’ın lisanssız eğitim verisi kullanımını savunan bir mahkeme görüşü sunduğu belirtiliyor, ancak bu güncel siyasi ve hukuki gelişme bağımsız olarak doğrulanamadığı için burada yalnızca kaynak metindeki iddia olarak aktarılıyor.

Microsoft belgeleri yayıncı trafiğindeki düşüşü de gündeme getiriyor

Mahkeme dosyasında aktarılan Microsoft verilerine göre, Copilot’un “yanıt motoru” biçimindeki kullanımı The New York Times alan adına yönlendirilen tıklamaların geleneksel Bing aramasına kıyasla bazı durumlarda yüzde 93’e kadar azalmasına yol açtı. Microsoft Uygulamalı Bilimler Direktörü Brent Hecht tarafından Ocak 2024’te hazırlandığı belirtilen şirket içi bir sunumda bu durum “doom loop” olarak tanımlanıyor ve içerik üreticilerinin zayıflamasının uzun vadede hem modelleri hem de açık web ekosistemini olumsuz etkileyebileceği ifade ediliyor. Dosyada alıntılanan Microsoft belgesi, bir ürünün kendi temel içerik tedarikçilerinin ekonomik yapısını tehdit etmesinin alışılmadık bir durum olduğunu ve büyük dil modelleri açısından böyle bir riskin ortaya çıktığını belirtiyor. Microsoft CEO’su Satya Nadella’nın da bu yıl verdiği ifadede, ödeme duvarı arkasındaki içeriklerin model eğitimi veya yapay zekâ sistemlerini bilgiyle destekleme amacıyla kullanılacaksa lisanslanması gerektiğini söylediği aktarılıyor. Nadella ayrıca OpenAI’ın ödeme duvarı arkasındaki içerikleri izinsiz biçimde toplayıp model eğitiminde kullandığını öğrenmiş olması hâlinde, Microsoft’un modellerin yeniden eğitilmesini isteme hakkını gündeme getirebileceğini ifade etmiş.

Dosyada OpenAI’ın ChatGPT’den sorumlu yöneticisi Nick Turley’e atfedilen şirket içi yazışmalar da yayıncıların karşı karşıya olduğu ekonomik riske işaret ediyor. Turley’in sohbet botlarının yayıncıların sunduğu içeriklerin yerini kısmen alabildiğini ve modeller geliştikçe bu etkinin artabileceğini söylediği belirtiliyor. OpenAI Başkanı Greg Brockman’ın modelleri haber konusunda “çok başarılı” olarak nitelendirdiği, Nadella’nın ise sohbet botlarının kullanıcının bilgiye doğrudan yapay zekâ arayüzü üzerinden ulaşmasını sağlayarak kaynak internet sitesine gitme ihtiyacını azaltabildiğini kabul ettiği aktarılıyor. The Times bu ifadeleri, yapay zekâ ürünlerinin yalnızca mevcut içerikleri dönüştürmediği, belirli kullanım senaryolarında orijinal içerikle doğrudan rekabet edebildiği yönündeki tezini desteklemek için kullanıyor. Microsoft’a ait başka bir belgede de üretken yapay zekânın, temel modellerin eğitildiği verileri üreten kişilerin istihdamını ciddi biçimde etkileyebileceğine ilişkin “gerçek bir risk” bulunduğu belirtiliyor.

Yeni açılan dosyalardaki en dikkat çekici başlıklardan biri de kullanılan veri miktarıyla ilgili. Mahkeme başvurusuna göre OpenAI’ın model eğitiminin ara aşamalarında kullanılan veri kümelerinde The New York Times, Daily News ve Center for Investigative Reporting tarafından yayımlanmış 91 bin 692’den fazla eserin kopyası bulunuyor. Common Crawl tabanlı başka bir veri kümesinin ise yalnızca nytimes.com alan adından iki milyondan fazla belge içerdiği öne sürülüyor. Brent Hecht’in Ocak 2023 tarihli bir şirket içi notunda bu ölçekteki veri kullanımını “benzeri görülmemiş ölçekte şaşırtıcı bir hırsızlık” ve “insanlık tarihindeki en büyük emek hırsızlığı” ifadeleriyle tanımladığı da The Times’ın başvurusunda yer alıyor. Bu sözlerin orijinal bağlamını içeren ek belgeler kamuya açık olmadığı için, ifadelerin tamamının hangi tartışma çerçevesinde kullanıldığını mevcut dosyadan görmek mümkün değil.

Günün Öne Çıkan Fırsatları

300 Hz ekranlı Game Garaj Slayer R9T, sepette 10.049,90 TL ucuzluyor
300 Hz ekranlı Game Garaj Slayer R9T, sepette 10.049,90 TL ucuzluyor
Satın Al
LG S40T soundbar ile 300 W ses, sepette 7.318,80 TL
LG S40T soundbar ile 300 W ses, sepette 7.318,80 TL
Satın Al
Google TV’li Next Stick 4K sepette 464,55 TL indirimli
Google TV’li Next Stick 4K sepette 464,55 TL indirimli
Satın Al
43 dB ANC’li QCY H3 kulaküstü kulaklık sepette 1.398 TL
43 dB ANC’li QCY H3 kulaküstü kulaklık sepette 1.398 TL
Satın Al
Havit TW984 ANC kulaklık, yüzde 15 sepet indirimiyle 636,65 TL
Havit TW984 ANC kulaklık, yüzde 15 sepet indirimiyle 636,65 TL
Satın Al
Tümünü Gör Daralt
Tüm Fırsatları Gör

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.

Başvuru ayrıca OpenAI ve Microsoft’un yayıncı içeriklerini nasıl topladığına ilişkin daha ayrıntılı iddialar da içeriyor. Dosyaya göre OpenAI, GPT-3 eğitim veri kümesinin tamamını Microsoft’a iletti ve Microsoft da bu verileri OpenAI modellerini kendi ticari ürünlerine nasıl entegre edebileceğini değerlendirmek amacıyla kullandı. Microsoft’un Project Taxi ve Project Mango adlı çalışmalar üzerinden OpenAI’a eğitim verisi sağladığı, Project Mango kapsamında oluşturulan veri kümesinde haber kuruluşlarına ait en az 160 bin 903 benzersiz eserin kopyasının bulunduğu iddia ediliyor. The Times’ın başvurusunda OpenAI çalışanlarının ödeme duvarlarını fark edilmeden aşmaya yönelik yöntemleri tartıştığı da belirtiliyor. OpenAI araştırmacısı Nick Ryder’ın Brockman’a The New York Times ödeme duvarını aşmak için bir yöntem bulduğunu bildirdiği ve Brockman’ın buna olumlu yanıt verdiği öne sürülüyor.

Belgelerde WebText ve WebText2 gibi OpenAI eğitim kümelerinin taranmış haber içeriklerine yüksek oranda dayandığı, bunun yanında Common Crawl arşivinden milyonlarca makalenin toplandığı da iddialar arasında bulunuyor. The Times ayrıca bazı araştırmacıların modelin kullanıcılara telif hakkı bildirimleri üretmesini istemedikleri gerekçesiyle eğitim verilerindeki telif bildirimlerinin çıkarılması yönünde çalıştığını ileri sürüyor. New York Daily News adına davayı takip eden avukat Steven Lieberman, yeni materyallerin OpenAI ve Microsoft’un yaptıkları uygulamaların sorunlu olduğunu bildiklerini gösterdiğini savunuyor. Buna karşılık söz konusu ifadelerin önemli bir kısmı davacıların sunduğu hukuki başvurudan geliyor ve temel belgelerin tümü henüz kamuya açık olmadığı için şirketlerin bu alıntılara ilişkin kapsamlı bağlamı görülemiyor. Dava bu yönüyle yalnızca geçmişte hangi içeriklerin model eğitiminde kullanıldığını değil, yapay zekâ şirketleri ile haber yayıncıları arasındaki lisanslama, trafik ve gelir paylaşımı tartışmalarının hangi hukuki sınırlar içinde şekilleneceğini de doğrudan ilgilendiriyor.

Teknoblog artık WhatsApp'taGünün en iyi teknoloji fırsatları ve kaçırmamanız gereken büyük haberler, telefonunuza gelsin.
Kanala Katıl