The New York Times’ın OpenAI ve Microsoft’a karşı yaklaşık üç yıl önce açtığı telif hakkı davasında kamuya açılan yeni belgeler, şirketlerin yapay zekâ modellerini eğitme yöntemleri ile yayıncıların içeriklerinin kullanımı konusundaki tartışmayı yeniden gündeme taşıdı. The Times’ın mahkemeye sunduğu sansürsüzleştirilmiş dosyada aktarılan şirket içi yazışmalara göre, üst düzey Microsoft çalışanları büyük ölçekli içerik toplama yöntemlerini son derece sert ifadelerle değerlendirdi. Aynı dosyada OpenAI yöneticilerinin, ChatGPT benzeri ürünlerin haber yayıncılarının iş modelleri üzerinde ciddi baskı oluşturabileceğini kabul ettiği öne sürülüyor. Belgeler bunun yanında ücretli içeriklere erişim, Bing dizininden veri alınması, Common Crawl kaynaklarının kullanılması ve eğitim verilerinden telif bildirimlerinin çıkarılması gibi uygulamalar hakkında da yeni ayrıntılar içeriyor. Bununla birlikte bu yeni bilgilerin önemli bir bölümü doğrudan şirket içi belgelerin tamamından değil, The New York Times’ın mahkemeye sunduğu hukuki metindeki alıntılardan geliyor ve ilgili eklerin bir kısmı hâlâ kamuya açık değil.
Davanın merkezinde, telif hakkıyla korunan haber içeriklerinin üretken yapay zekâ modellerinin eğitiminde izin alınmadan kullanılmasının hukuken kabul edilebilir olup olmadığı sorusu bulunuyor. OpenAI ve Microsoft, bu tür kullanımın ABD telif hukukundaki “fair use”, yani adil kullanım ilkesi kapsamında değerlendirilebileceğini savunuyor. Bu ilke belirli koşullarda telifli eserlerin hak sahibinden izin alınmadan kullanılmasına imkân tanıyor, fakat değerlendirmede kullanımın niteliği kadar orijinal eserin ekonomik pazarına etkisi de hesaba katılıyor. The Times’ın son başvurusunda öne çıkardığı şirket içi ifadeler de özellikle bu ekonomik etki başlığına odaklanıyor. Kaynak metinde Trump yönetiminin kısa süre önce OpenAI’ın lisanssız eğitim verisi kullanımını savunan bir mahkeme görüşü sunduğu belirtiliyor, ancak bu güncel siyasi ve hukuki gelişme bağımsız olarak doğrulanamadığı için burada yalnızca kaynak metindeki iddia olarak aktarılıyor.
Microsoft belgeleri yayıncı trafiğindeki düşüşü de gündeme getiriyor
Mahkeme dosyasında aktarılan Microsoft verilerine göre, Copilot’un “yanıt motoru” biçimindeki kullanımı The New York Times alan adına yönlendirilen tıklamaların geleneksel Bing aramasına kıyasla bazı durumlarda yüzde 93’e kadar azalmasına yol açtı. Microsoft Uygulamalı Bilimler Direktörü Brent Hecht tarafından Ocak 2024’te hazırlandığı belirtilen şirket içi bir sunumda bu durum “doom loop” olarak tanımlanıyor ve içerik üreticilerinin zayıflamasının uzun vadede hem modelleri hem de açık web ekosistemini olumsuz etkileyebileceği ifade ediliyor. Dosyada alıntılanan Microsoft belgesi, bir ürünün kendi temel içerik tedarikçilerinin ekonomik yapısını tehdit etmesinin alışılmadık bir durum olduğunu ve büyük dil modelleri açısından böyle bir riskin ortaya çıktığını belirtiyor. Microsoft CEO’su Satya Nadella’nın da bu yıl verdiği ifadede, ödeme duvarı arkasındaki içeriklerin model eğitimi veya yapay zekâ sistemlerini bilgiyle destekleme amacıyla kullanılacaksa lisanslanması gerektiğini söylediği aktarılıyor. Nadella ayrıca OpenAI’ın ödeme duvarı arkasındaki içerikleri izinsiz biçimde toplayıp model eğitiminde kullandığını öğrenmiş olması hâlinde, Microsoft’un modellerin yeniden eğitilmesini isteme hakkını gündeme getirebileceğini ifade etmiş.
İLGİNİZİ ÇEKEBİLİR

Microsoft yapay zekâ yarışında sınırlarını açıkça çizdi

OpenAI, Google ve Anthropic yapay zekâ güvenliğinde birlikte hareket ediyor

Google ve BM yapay zekânın veri sorununa el atıyor

Microsoft yapay zeka için insan odaklı bir anayasa hazırladı

Yapay zekâ yavaşlamalı mı? Teknoloji dünyasının en güçlü isimleri karşı karşıya
Dosyada OpenAI’ın ChatGPT’den sorumlu yöneticisi Nick Turley’e atfedilen şirket içi yazışmalar da yayıncıların karşı karşıya olduğu ekonomik riske işaret ediyor. Turley’in sohbet botlarının yayıncıların sunduğu içeriklerin yerini kısmen alabildiğini ve modeller geliştikçe bu etkinin artabileceğini söylediği belirtiliyor. OpenAI Başkanı Greg Brockman’ın modelleri haber konusunda “çok başarılı” olarak nitelendirdiği, Nadella’nın ise sohbet botlarının kullanıcının bilgiye doğrudan yapay zekâ arayüzü üzerinden ulaşmasını sağlayarak kaynak internet sitesine gitme ihtiyacını azaltabildiğini kabul ettiği aktarılıyor. The Times bu ifadeleri, yapay zekâ ürünlerinin yalnızca mevcut içerikleri dönüştürmediği, belirli kullanım senaryolarında orijinal içerikle doğrudan rekabet edebildiği yönündeki tezini desteklemek için kullanıyor. Microsoft’a ait başka bir belgede de üretken yapay zekânın, temel modellerin eğitildiği verileri üreten kişilerin istihdamını ciddi biçimde etkileyebileceğine ilişkin “gerçek bir risk” bulunduğu belirtiliyor.
Yeni açılan dosyalardaki en dikkat çekici başlıklardan biri de kullanılan veri miktarıyla ilgili. Mahkeme başvurusuna göre OpenAI’ın model eğitiminin ara aşamalarında kullanılan veri kümelerinde The New York Times, Daily News ve Center for Investigative Reporting tarafından yayımlanmış 91 bin 692’den fazla eserin kopyası bulunuyor. Common Crawl tabanlı başka bir veri kümesinin ise yalnızca nytimes.com alan adından iki milyondan fazla belge içerdiği öne sürülüyor. Brent Hecht’in Ocak 2023 tarihli bir şirket içi notunda bu ölçekteki veri kullanımını “benzeri görülmemiş ölçekte şaşırtıcı bir hırsızlık” ve “insanlık tarihindeki en büyük emek hırsızlığı” ifadeleriyle tanımladığı da The Times’ın başvurusunda yer alıyor. Bu sözlerin orijinal bağlamını içeren ek belgeler kamuya açık olmadığı için, ifadelerin tamamının hangi tartışma çerçevesinde kullanıldığını mevcut dosyadan görmek mümkün değil.
Günün Öne Çıkan Fırsatları

REKLAM — Bu içerikte satış ortaklığı bağlantıları bulunmaktadır. Bu bağlantılar üzerinden yapılan alışverişlerden Teknoblog komisyon kazanabilir.
Başvuru ayrıca OpenAI ve Microsoft’un yayıncı içeriklerini nasıl topladığına ilişkin daha ayrıntılı iddialar da içeriyor. Dosyaya göre OpenAI, GPT-3 eğitim veri kümesinin tamamını Microsoft’a iletti ve Microsoft da bu verileri OpenAI modellerini kendi ticari ürünlerine nasıl entegre edebileceğini değerlendirmek amacıyla kullandı. Microsoft’un Project Taxi ve Project Mango adlı çalışmalar üzerinden OpenAI’a eğitim verisi sağladığı, Project Mango kapsamında oluşturulan veri kümesinde haber kuruluşlarına ait en az 160 bin 903 benzersiz eserin kopyasının bulunduğu iddia ediliyor. The Times’ın başvurusunda OpenAI çalışanlarının ödeme duvarlarını fark edilmeden aşmaya yönelik yöntemleri tartıştığı da belirtiliyor. OpenAI araştırmacısı Nick Ryder’ın Brockman’a The New York Times ödeme duvarını aşmak için bir yöntem bulduğunu bildirdiği ve Brockman’ın buna olumlu yanıt verdiği öne sürülüyor.
Belgelerde WebText ve WebText2 gibi OpenAI eğitim kümelerinin taranmış haber içeriklerine yüksek oranda dayandığı, bunun yanında Common Crawl arşivinden milyonlarca makalenin toplandığı da iddialar arasında bulunuyor. The Times ayrıca bazı araştırmacıların modelin kullanıcılara telif hakkı bildirimleri üretmesini istemedikleri gerekçesiyle eğitim verilerindeki telif bildirimlerinin çıkarılması yönünde çalıştığını ileri sürüyor. New York Daily News adına davayı takip eden avukat Steven Lieberman, yeni materyallerin OpenAI ve Microsoft’un yaptıkları uygulamaların sorunlu olduğunu bildiklerini gösterdiğini savunuyor. Buna karşılık söz konusu ifadelerin önemli bir kısmı davacıların sunduğu hukuki başvurudan geliyor ve temel belgelerin tümü henüz kamuya açık olmadığı için şirketlerin bu alıntılara ilişkin kapsamlı bağlamı görülemiyor. Dava bu yönüyle yalnızca geçmişte hangi içeriklerin model eğitiminde kullanıldığını değil, yapay zekâ şirketleri ile haber yayıncıları arasındaki lisanslama, trafik ve gelir paylaşımı tartışmalarının hangi hukuki sınırlar içinde şekilleneceğini de doğrudan ilgilendiriyor.






