Beş saniyede ses klonlamak

QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
Scream (Çığlık) serisindeki yeriyle dikkatimizi çekmiş olan "ses değiştirme" teknolojisi 2000’lerin başında biraz fütürist kaldığı için unutulmuştu. Yapay zekânın toplum nezdinde yeri de Terminatör filmlerindeki aksiyon dolu profilden nötr ve gündelik hayatı kolaylaştıran bir teknoloji kavramına gelişince bu iki teknolojinin birleşmesi "ses değiştirme" ya da daha doğru bir yaklaşımla "ses taklit etme" teknolojisinin hayatımıza yeniden girmesini sağladı.
- Cornell Üniversitesi'nin bilgisayar bilimleri departmanı tarafından yayımlanan iki makalenin pratik denemeleri, yapay zekâ tabanlı sistemin bir sesi sadece beş saniye dinleyerek klonlamasına olanak sağladı. Hâlihazırda belli seviyede gelişmiş olan ses klonlama teknolojisi çeşitli örnekleriyle beraber telefon uygulamalarında ve özel yapım videolarda yer almıştı.
- Neden Ünlüler? Ses klonlama teknolojisinin temelinde yapay zekâ yatıyor (evet doğru bildiniz). Yapay zekâ çok geniş bir konsept adı olmasının yanında makine öğrenmesi modeli, temel olarak bir bilgisayarın büyük hacimli verileri alması ve bir metodolojiye bağlı kalarak işlemesinden ibaret. Dolayısıyla bir modelin istenen veya tarif edilen bir işi yüksek verimle gerçekleştirmesi için çok sayıda örnek veriye ihtiyacı var. Tam da bu yüzden bir ünlünün filmlerdeki replikleri, söylediği şarkılar, televizyondan yayımlanmış olan röportajlar ve Youtube gibi kaynaklarda bulunan içerikleri o kişinin sesini; klonlamak için benzersiz bir aday hâline getiriyor.
- Normalde saatlerce süren ses kayıtlarıyla gerçekleştirilebilen bu klonlama işleminin beş saniyeye kadar inmesinin arkasında yatan metodoloji ise şimdiye kadar toplanmış verilerin sağladığı ses tanıma fonksiyonunun geri beslemeyle verimli bir şekilde yapılanmasına dayanıyor. Yazıdan ses üretimini yapay sinir ağlarını kullanarak oluşturan araştırmacılar, modelin kendisine daha önce öğretilmemiş olan sesleri de algıladıktan sonra konuşma yaratabildiğini belirtiyor. Bunu birbirinden bağımsız üç içerik ile mümkün kılıyorlar
- WaveNet: DeepMind yapay zekâ şirketi tarafından geliştirilen ham ses oluşturucusu. Yapay sinir ağları, verilen dalga şekilleriyle oynayarak gerçekte var olmayan seslerin geliştirilmesini sağlıyor.
- Spektrogram: Ses bilgisinin grafiksel gösterimi.
- Birbirinden bağımsız gürültülü seslerden oluşan veri setinin işlenerek bir konuşmacı doğrulama görevi üzerine eğitilmesi sonucu hedeften alınan konuşmayı saniyeler içerisinde referans hâle getirmeye yarayan kodlayıcı ağ sistemi.
- Girilen metinlerden bir spektrogram oluşturan, verilen sesi diziden diziye sentezleyen ağ sistemi.
- Spektrogram üzerinden alınan bilgiyi ses dalgasına dönüştüren kendiliğinden öğrenmesini pekiştiren WaveNet tabanlı ses kodlayıcı.
- Bu üç yapının birbiriyle bağlantısı sonucu oluşan sistem, ilk olarak dinlediği beş saniyelik sesi daha önce dinlediği seslerle ve öğrendiği nüanslarla karşılaştırıyor. Bu eşleşme sonrasında elde edilen uygun denkliklerden yola çıkarak benzer seslerin "fotoğrafları" en doğru model oluşturuluyor. Sesin söylemesi istenen yazı da yine daha önceki ses fotoğraflarından öğrenilerek yeni sese adapte ediliyor. Sonuç olarak da sadece beş saniyelik bilgi zenginleştirilmiş bir verimle çok sayıda cümleyi seslendirebilir hâle geliyor.
- İşte şimdi; favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin, sesinizi başkalarına hediye edebilmenizin veya telefonda en yakın arkadaşınız sandığınız kişinin aslında başka biri çıkmasının sebebini biliyorsunuz!
Kaydet
Okuma listesine ekle
Paylaş
QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
İLGİLİ BAŞLIKLAR
NEREDE YAYIMLANDI?
Bu sayımızda yapay zekânın kabalığını, Twitter #hack’ini gerçekleştiren Ivan’ın sosyal mühendisliğini ve beş saniyede ses klonlamayı ele aldık.
13 Ağu 2020

YAZARLAR

Quando
Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
İLGİLİ OKUMALAR
Son birkaç yıldır yapay zeka yarışında geçerli olan kural basitti: Daha güçlü modeli daha hızlı geliştiren kazanır. Son günlerde sektörün öncü isimleri tarafından yapılan açıklamalar ise bu denklemin değişmeye başladığını gösteriyor. Modellerin siber saldırılardan biyolojik silah geliştirme girişimlerine uzanan riskli kullanım alanlarında sahneye çıkması, yarışın öncülerini ilk kez açık bir biçimde frene basma olasılığını tartışmaya itiyor.

Yapay zeka yarışını yavaşlatma çağrıları teknoloji şirketlerinin içinden de yükselirken, New York Üniversitesi’nden filozof Jeff Sebo ile yapay zekanın risklerini, bilinç ihtimalini, hayvan refahını ve gelecekte dijital zihinlere karşı doğabilecek sorumluluklarımızı konuştuk.

Gıda markaları, restoranlar ve kafeler, son dönemlerde giderek artan oranda yapay zeka üretimi görsellere başvuruyor. Fakat bu görseller, iştah açıcı görünmek yerine, “mide bulandıran” etkileriyle viral oluyorlar. Bu durum, dikkat çekici bir soruyu da gündeme taşıyor: Fotogerçekçi görüntüler üretme konusunda bu denli yetenekli hâle gelen yapay zeka modelleri, neden iştah açıcı yemek görselleri üretemiyor?

Türkiye, 15 yaş altına sosyal medya yasağını uygulamaya hazırlanırken yaş doğrulama için e-Devlet üzerinden token modeli gündemde. Çocukları sosyal medyanın zararlarından korumayı amaçlayan bu sistem, bütün kullanıcıların önce devletin kimlik altyapısından geçmesini gerektirebilir. Çocukları korumak amacıyla kurulan bu sistem, kullanıcıların kimliğiyle hesapları arasındaki bağı devletin elinde görünür hâle getirir mi? Yetişkinlerin anonimlik hakkı bundan nasıl etkilenecek?

Apple, her yıl Eylül ayında düzenlediği geleneksel lansman etkinliğini bu yıl 9 Eylül Çarşamba günü “Sürpriz ve Parıltı” sloganıyla hayata geçirdi. Etkinlikte ilk katlanabilir iPhone modeli iPhone Duo’nun yanı sıra iPhone 18 Pro, iPhone 18 Pro Max, Apple Watch Series 12, Apple Watch Ultra 4 ve AirPods 5 de tanıtıldı. Şirket ayrıca, en yeni mobil işletim sistemi sürümü iOS 27’nin çıkış tarihini de duyurdu.



