Yapay zekada telif tartışmaları: Modeller YouTube ile eğitiliyor

Hâlâ hiçbir ülkede net sınırlar çizen düzenlemelerle kontrol altına alınmayan yapay zeka, adeta “Teknolojinin Vahşi Batısı” olmayı sürdürüyor. Engelleyici hiçbir düzenleme de olmayınca, şirketler yapay zekayı eğitmek için çocuk fotoğraflarından herkese açık sosyal medya paylaşımlarına kadar pek çok içeriği serbestçe kullanabiliyor. Buna karşılık ise yayıncılar içerik üreticileri ve yazarlar haklarını aramak için yapay zeka alanında etiğin sınırlarını belirlemeye çalışan mahkemelere başvuruyor.
Rapor: Proof News tarafından yapılan yeni bir araştırma, aralarında Anthropic, Salesforce, NVIDIA ve Apple’ın da bulunduğu teknoloji şirketlerinin yapay zeka modellerini eğitmek için YouTube videolarına ait materyalleri izinsiz olarak kullandıklarını tespit etti. Üstelik söz konusu hamle, YouTube’un platformdan izinsiz olarak içerik alınmasını yasaklayan platform politikalarına rağmen yapılabildi.
Araştırmaya göre bahsi geçen şirketler, 48 binden fazla kanaldan alınan 173 binin üzerindeki YouTube videosunun altyazılarını kullandı.
Söz konusu altyazılara, kâr amacı gütmeyen yapay zeka araştırma grubu EleutherAI’ın oluşturduğu “YouTube Subtitles” isimli bir veri kümesi aracılığıyla erişildi.
Veri setinde Khan Academy, Massachusetts Teknoloji Enstitüsü (MIT) ve Harvard Üniversitesi gibi eğitim kurumlarının videolarının transkriptlerinin yanı sıra The Late Show With Stephen Colbert, Last Week Tonight With John Oliver ve Jimmy Kimmel Live gibi programların YouTube'a yüklenen kısımlarının altyazıları da bulunuyor.
The Wall Street Journal, NPR ve BBC gibi yayın kuruluşlarının videolarının transkriptleri de veri setinde yer alıyor.
2020 yılında yayımlanan veri kümesinde, takip eden yıllarda silinmiş 12 binden fazla YouTube videosunun altyazıları da bulunuyor.
İçerik üreticileri, kendilerinden izin alınmadığını söylüyor
MrBeast, Marques Brownlee, Jackepticeye, PewDiePie, Crash Course, Einstein Parrot ve SciShow gibi yüz binlerce aboneye sahip YouTube kanallarının video altyazılarının da “YouTube Subtitles” veri setinde bulunduğu görülüyor. Yapay zekayı eğitmek için kullanılan videolardan bazılarında "düz dünya" gibi komplo teorilerini destekleyen içerikler de yer alıyor.
Tepkiler: Veri setinde 160’a yakın videosunun transkripti bulunan The David Pakman Show sunucusu David Pakman, konuya ilişkin açıklamasında “Kimse bana gelip ‘Bunu kullanmak istiyoruz’ demedi” diyor. Verilerini kullanan şirketlerin kendisine tazminat ödemesi gerektiğine işaret eden Pakman, YouTube’un geçim kaynağı olduğunun ve bu içerikleri oluşturmak için zaman, para ve kaynak kullanmasının yanı sıra dört tam zamanlı personelden destek aldığının da altını çiziyor.
Bazı içeriklerinin altyazısı YouTube’dan alınarak veri kümesine dahil edilen dijital yayın platformu Nebula’nın CEO’su Dave Whiskus ise yapılanın bir hırsızlık olduğunu söylüyor.
Whiskus ayrıca, stüdyoların söz konusu veri setini kullanarak üretken yapay zekayı giderek daha da fazla sayıda sanatçının yerini alacak şekilde eğitebileceğine işaret ediyor.
Proof News, içerik üreticilerin kanal isimleri veya video başlıklarını kullanarak içeriklerinin veri setine dahil edilip edilmediğini öğrenebilecekleri bir arama motoru da oluşturdu.
Bilgi notu: EleutherAI tarafından yayımlanan bir makaleye göre veri seti Avrupa Parlamentosu belgeleri ve Wikipedia içeriklerinden de materyaller içeriyor. Yeterli depolama alanı ve bilgi işlem gücüne sahip olan herkes, veri setine ücretsiz olarak erişebiliyor.
Makaleye göre daha önce akademisyenler ve yazılımcılar da söz konusu veri kümesinden faydalandı.
Açıklamalar: Proof News’in raporunun ardından Anthropic ve Salesforce, yasadışı bir eylemde bulunduklarına yönelik iddiaları reddederek “YouTube Subtitles” veri setini kullandıklarını doğruladı.
Apple, veri kümesini Nisan ayında piyasaya sürdüğü “OpenELM” isimli yapay zeka modelini eğitmek için kullandığına işaret etti. OpenELM’in hiçbir yapay zeka veya makine öğrenimi özelliğini desteklemediğini vurgulayan Apple, modelin yalnızca araştırmalara katkıda bulunmak amacıyla kullanıldığını dile getirdi.
Bu doğrultuda YouTube Subtitles’ın şirketin “Apple Intelligence” isimli yapay zeka özelliklerini eğitmek için kullanıldığına yönelik iddialar yalanlandı. Apple, veri kümesini Apple Intelligence’ı eğitmek için hiçbir zaman kullanmayı planlamadığını da sözlerine ekledi.
Anthropic sözcüsü Jennifer Martinez ise “YouTube Subtitles” veri kümesini kullandıklarını doğrulayarak YouTube platform şartlarının platformdaki materyallerin doğrudan kullanımını yasakladığını vurguladı ve herhangi bir politika ihlali yapmadıklarına işaret etti.
Veri setinin akademik çalışmalar ve araştırmaları hedefleyen bir yapay zeka modeli oluşturmak için kullanıldığını belirten Salesforce yetkilileri de “YouTube Subtitles” veri kümesinin herkese açık olduğunu dile getirdi.
Önemli ayrıntı: Salesforce geliştiricileri, 2022’de yaygın kullanıma açılan yapay zeka modeliyle ilgili bulgularını raporladıkları makalede veri setinin küfür, belirli cinsel kimliklere ve dini gruplara yönelik ayrımcılık ve ırkçılık gibi öğeler barındırdığını not etmişti.
Proof News, Bloomberg ve Databricks’in de YouTube Subtitles’ı içinde barındıran veri kümesi grubu Pile’ı kullanarak yapay zeka modellerini eğittiklerini tespit etti.
Google ve OpenAI da benzer iddialara konu olmuştu
Bu yılın başlarında yayımlanan bir The New York Times haberi de Google’ın yapay zeka modellerini eğitmek için YouTube’daki içerikleri kullandığını iddia etmişti. İddialara yanıt veren bir Google sözcüsü, YouTube içerik üreticileriyle yapılan anlaşmalar kapsamında içerikleri kullanmaya yetkileri olduğunu dile getirmişti.
Ek olarak: The Times tarafından yapılan bir araştırma da OpenAI’ın metin komutlarından video oluşturan yapay zeka aracı Sora’yı eğitmek için YouTube videolarını kullandığına işaret etmişti.
OpenAI’ın teknolojiden sorumlu baş yöneticisi Mira Murati ise kendisine bu iddialar sorulduğunda “Bundan emin değilim” şeklinde yanıt vermişti.
Perspektif: Yapay zeka politikaları üzerine çalışmalar yürüten Jai Vipra, yapay zeka şirketlerinin görece daha yüksek kalitede veriler üzerinden kendi modellerini eğiterek rekabet güçlerini artırdığını söylüyor. Vipra, bu nedenle YouTube videoları ya da kitaplar gibi çoğu zaman kaliteli veri sunan içeriklerin bu şirketler için bir “altın madeni” olduğuna işaret ediyor. Zira bu tip içerikler, yapay zeka modellerinin iletişim kurma biçimini çok daha gerçekçi ve insana yakın hale getiriyor.
İçerik üreticileriyse yayınladıkları içerikler yapay zekayı eğitmek için kullanıldıktan sonra, söz konusu verilerin artık yapay zekaya unutturulamayacağını ve kendilerini bekleyen gelecek konusunda endişeli olduklarını dile getiriyor.
Editörün önerisi | Yapay zekanın karanlık yüzü: Çocuk fotoğrafları nasıl kullanılıyor?
Kaydet
Okuma listesine ekle
Paylaş
İLGİLİ BAŞLIKLAR
NEREDE YAYIMLANDI?
Yeni bir araştırma, büyük teknoloji şirketlerinin YouTube altyazılarını kullanarak yapay zeka modellerini eğittiğini ortaya çıkardı. Amazon, yapay zeka destekli alışveriş asistanı Rufus’u kullanıma sundu. OpenAI, GPT-4o mini’yi tanıttı.
20 Tem 2024

YAZARLAR

Doğa Yurduneri
İş dünyası ve teknoloji editörü.

Quando AI
Yapay zeka dünyasından son gelişmeler, hayatınızı daha verimli kılacak yeni AI araçları, yatırım alan girişimler ve yapay zeka üzerine tartışmalar.
İLGİLİ OKUMALAR



