Beş saniyede ses klonlamak

QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
Scream (Çığlık) serisindeki yeriyle dikkatimizi çekmiş olan "ses değiştirme" teknolojisi 2000’lerin başında biraz fütürist kaldığı için unutulmuştu. Yapay zekânın toplum nezdinde yeri de Terminatör filmlerindeki aksiyon dolu profilden nötr ve gündelik hayatı kolaylaştıran bir teknoloji kavramına gelişince bu iki teknolojinin birleşmesi "ses değiştirme" ya da daha doğru bir yaklaşımla "ses taklit etme" teknolojisinin hayatımıza yeniden girmesini sağladı.
- Cornell Üniversitesi'nin bilgisayar bilimleri departmanı tarafından yayımlanan iki makalenin pratik denemeleri, yapay zekâ tabanlı sistemin bir sesi sadece beş saniye dinleyerek klonlamasına olanak sağladı. Hâlihazırda belli seviyede gelişmiş olan ses klonlama teknolojisi çeşitli örnekleriyle beraber telefon uygulamalarında ve özel yapım videolarda yer almıştı.
- Neden Ünlüler? Ses klonlama teknolojisinin temelinde yapay zekâ yatıyor (evet doğru bildiniz). Yapay zekâ çok geniş bir konsept adı olmasının yanında makine öğrenmesi modeli, temel olarak bir bilgisayarın büyük hacimli verileri alması ve bir metodolojiye bağlı kalarak işlemesinden ibaret. Dolayısıyla bir modelin istenen veya tarif edilen bir işi yüksek verimle gerçekleştirmesi için çok sayıda örnek veriye ihtiyacı var. Tam da bu yüzden bir ünlünün filmlerdeki replikleri, söylediği şarkılar, televizyondan yayımlanmış olan röportajlar ve Youtube gibi kaynaklarda bulunan içerikleri o kişinin sesini; klonlamak için benzersiz bir aday hâline getiriyor.
- Normalde saatlerce süren ses kayıtlarıyla gerçekleştirilebilen bu klonlama işleminin beş saniyeye kadar inmesinin arkasında yatan metodoloji ise şimdiye kadar toplanmış verilerin sağladığı ses tanıma fonksiyonunun geri beslemeyle verimli bir şekilde yapılanmasına dayanıyor. Yazıdan ses üretimini yapay sinir ağlarını kullanarak oluşturan araştırmacılar, modelin kendisine daha önce öğretilmemiş olan sesleri de algıladıktan sonra konuşma yaratabildiğini belirtiyor. Bunu birbirinden bağımsız üç içerik ile mümkün kılıyorlar
- WaveNet: DeepMind yapay zekâ şirketi tarafından geliştirilen ham ses oluşturucusu. Yapay sinir ağları, verilen dalga şekilleriyle oynayarak gerçekte var olmayan seslerin geliştirilmesini sağlıyor.
- Spektrogram: Ses bilgisinin grafiksel gösterimi.
- Birbirinden bağımsız gürültülü seslerden oluşan veri setinin işlenerek bir konuşmacı doğrulama görevi üzerine eğitilmesi sonucu hedeften alınan konuşmayı saniyeler içerisinde referans hâle getirmeye yarayan kodlayıcı ağ sistemi.
- Girilen metinlerden bir spektrogram oluşturan, verilen sesi diziden diziye sentezleyen ağ sistemi.
- Spektrogram üzerinden alınan bilgiyi ses dalgasına dönüştüren kendiliğinden öğrenmesini pekiştiren WaveNet tabanlı ses kodlayıcı.
- Bu üç yapının birbiriyle bağlantısı sonucu oluşan sistem, ilk olarak dinlediği beş saniyelik sesi daha önce dinlediği seslerle ve öğrendiği nüanslarla karşılaştırıyor. Bu eşleşme sonrasında elde edilen uygun denkliklerden yola çıkarak benzer seslerin "fotoğrafları" en doğru model oluşturuluyor. Sesin söylemesi istenen yazı da yine daha önceki ses fotoğraflarından öğrenilerek yeni sese adapte ediliyor. Sonuç olarak da sadece beş saniyelik bilgi zenginleştirilmiş bir verimle çok sayıda cümleyi seslendirebilir hâle geliyor.
- İşte şimdi; favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin, sesinizi başkalarına hediye edebilmenizin veya telefonda en yakın arkadaşınız sandığınız kişinin aslında başka biri çıkmasının sebebini biliyorsunuz!
Kaydet
Okuma listesine ekle
Paylaş
QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
İLGİLİ BAŞLIKLAR
NEREDE YAYIMLANDI?
Bu sayımızda yapay zekânın kabalığını, Twitter #hack’ini gerçekleştiren Ivan’ın sosyal mühendisliğini ve beş saniyede ses klonlamayı ele aldık.
13 Ağu 2020

YAZARLAR

Quando
Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
İLGİLİ OKUMALAR
Televizyonda sunucuların “50 milyon bizi izliyor” dediği günlerden herkesin kendisi için üretilmiş başka bir içerik akışında yaşadığı "yankı odaları" dünyasına geldik. Sosyal medya ortak metni parçaladı, üretken yapay zeka ise kişiselleştirmeyi başka bir aşamaya taşıdı. Peki bu ortamda kitle iletişimi tamamen öldü mü? Belki de buradaki asıl krizi erişimin azalması değil, ortak gerçekliği kuran sistemlerin giderek daha az hesap verebilir hâle gelmesi olarak okumalıyız.

Kanada’da bir okul saldırganının ChatGPT hesabının sekiz ay önce şiddet içerikli kullanım nedeniyle işaretlendiğinin ortaya çıkması, sohbet botlarının kullanıcılarını ne ölçüde izlemesi ve hangi noktada yetkililere bildirmesi gerektiği tartışmasını büyüttü. British Columbia’nın OpenAI’a karşı açtığı dava, mahremiyet ile güvenlik arasındaki sınırın nerede çizileceğini tartışmaya açarken Türkiye’de okul saldırıları sonrası alınan önlemler benzer bir sorunun başka bir yüzünü gösteriyor.

Yapay zekanın insanlığı yok edeceğine dair felaket senaryoları, genellikle kontrolden çıkan süper zekalara ve “katil robotlara” odaklanıyor. Oysa uzmanların daha olası gördüğü risklerin çoğunda yapay zeka tek başına hareket etmiyor. Özellikle beş olası senaryo, kontrol zincirini geri dönüşü olmayacak şekilde kırma potansiyeli taşıyor.

Yapay zeka patlamasının da etkisiyle artık ürünlerin pazarlama materyallerinde sürekli aynı kelimeler tekrarlanıyor: Ajan tabanlı, AI destekli, kurumsal düzeyde, akıllı, uçtan uca, yeni nesil, ekosistem… Yıllar önce pazarlama ekiplerinin temel problemi, insanların üründen haberdar olmasını sağlamakken bugün bunun önünde çok daha kritik bir problem yer alıyor: İnsanların ürünün ne olduğunu anlamasını sağlamak.

Son birkaç yıldır yapay zeka yarışında geçerli olan kural basitti: Daha güçlü modeli daha hızlı geliştiren kazanır. Son günlerde sektörün öncü isimleri tarafından yapılan açıklamalar ise bu denklemin değişmeye başladığını gösteriyor. Modellerin siber saldırılardan biyolojik silah geliştirme girişimlerine uzanan riskli kullanım alanlarında sahneye çıkması, yarışın öncülerini ilk kez açık bir biçimde frene basma olasılığını tartışmaya itiyor.



