Beş saniyede ses klonlamak

Favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin arka planı.
Beş saniyede ses klonlamak

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

Scream (Çığlık) serisindeki yeriyle dikkatimizi çekmiş olan "ses değiştirme" teknolojisi 2000’lerin başında biraz fütürist kaldığı için unutulmuştu. Yapay zekânın toplum nezdinde yeri de Terminatör filmlerindeki aksiyon dolu profilden nötr ve gündelik hayatı kolaylaştıran bir teknoloji kavramına gelişince bu iki teknolojinin birleşmesi "ses değiştirme" ya da daha doğru bir yaklaşımla "ses taklit etme" teknolojisinin hayatımıza yeniden girmesini sağladı. 

  • Cornell Üniversitesi'nin bilgisayar bilimleri departmanı tarafından yayımlanan iki makalenin pratik denemeleri, yapay zekâ tabanlı sistemin bir sesi sadece beş saniye dinleyerek klonlamasına olanak sağladı. Hâlihazırda belli seviyede gelişmiş olan ses klonlama teknolojisi çeşitli örnekleriyle beraber telefon uygulamalarında ve özel yapım videolarda yer almıştı. 
     
  • Neden Ünlüler? Ses klonlama teknolojisinin temelinde yapay zekâ yatıyor (evet doğru bildiniz). Yapay zekâ çok geniş bir konsept adı olmasının yanında makine öğrenmesi modeli, temel olarak bir bilgisayarın büyük hacimli verileri alması ve bir metodolojiye bağlı kalarak işlemesinden ibaret. Dolayısıyla bir modelin istenen veya tarif edilen bir işi yüksek verimle gerçekleştirmesi için çok sayıda örnek veriye ihtiyacı var. Tam da bu yüzden bir ünlünün filmlerdeki replikleri, söylediği şarkılar, televizyondan yayımlanmış olan röportajlar ve Youtube gibi kaynaklarda bulunan içerikleri o kişinin sesini; klonlamak için benzersiz bir aday hâline getiriyor. 
     
  • Normalde saatlerce süren ses kayıtlarıyla gerçekleştirilebilen bu klonlama işleminin beş saniyeye kadar inmesinin arkasında yatan metodoloji ise şimdiye kadar toplanmış verilerin sağladığı ses tanıma fonksiyonunun geri beslemeyle verimli bir şekilde yapılanmasına dayanıyor. Yazıdan ses üretimini yapay sinir ağlarını kullanarak oluşturan araştırmacılar, modelin kendisine daha önce öğretilmemiş olan sesleri de algıladıktan sonra konuşma yaratabildiğini belirtiyor. Bunu birbirinden bağımsız üç içerik ile mümkün kılıyorlar
     
  • WaveNet: DeepMind yapay zekâ şirketi tarafından geliştirilen ham ses oluşturucusu. Yapay sinir ağları, verilen dalga şekilleriyle oynayarak gerçekte var olmayan seslerin geliştirilmesini sağlıyor. 
     
  • Spektrogram: Ses bilgisinin grafiksel gösterimi.
     
  • Birbirinden bağımsız gürültülü seslerden oluşan veri setinin işlenerek bir konuşmacı doğrulama görevi üzerine eğitilmesi sonucu hedeften alınan konuşmayı saniyeler içerisinde referans hâle getirmeye yarayan kodlayıcı ağ sistemi.
     
  • Girilen metinlerden bir spektrogram oluşturan, verilen sesi diziden diziye sentezleyen ağ sistemi.
     
  • Spektrogram üzerinden alınan bilgiyi ses dalgasına dönüştüren kendiliğinden öğrenmesini pekiştiren WaveNet tabanlı ses kodlayıcı.
     
  • Bu üç yapının birbiriyle bağlantısı sonucu oluşan sistem, ilk olarak dinlediği beş saniyelik sesi daha önce dinlediği seslerle ve öğrendiği nüanslarla karşılaştırıyor. Bu eşleşme sonrasında elde edilen uygun denkliklerden yola çıkarak benzer seslerin "fotoğrafları" en doğru model oluşturuluyor. Sesin söylemesi istenen yazı da yine daha önceki ses fotoğraflarından öğrenilerek yeni sese adapte ediliyor. Sonuç olarak da sadece beş saniyelik bilgi zenginleştirilmiş bir verimle çok sayıda cümleyi seslendirebilir hâle geliyor. 
     
  • İşte şimdi; favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin, sesinizi başkalarına hediye edebilmenizin veya telefonda en yakın arkadaşınız sandığınız kişinin aslında başka biri çıkmasının sebebini biliyorsunuz!
Hikâyeyi paylaşmak için:

Kaydet

Okuma listesine ekle

Paylaş

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

NEREDE YAYIMLANDI?

QuandoQuando
∙

BÜLTEN SAYISI

📠 Kaba AI ve çocuk hacker

Bu sayımızda yapay zekânın kabalığını, Twitter #hack’ini gerçekleştiren Ivan’ın sosyal mühendisliğini ve beş saniyede ses klonlamayı ele aldık.

13 Ağu 2020

📠 Kaba AI ve çocuk hacker

YAZARLAR

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

İLGİLİ OKUMALAR

QuandoQuando
∙

HİKAYE

‘İletişimsiz kitle’ gerçeği: Herkese ulaşmak ama kimseyle buluşamamak

Televizyonda sunucuların “50 milyon bizi izliyor” dediği günlerden herkesin kendisi için üretilmiş başka bir içerik akışında yaşadığı "yankı odaları" dünyasına geldik. Sosyal medya ortak metni parçaladı, üretken yapay zeka ise kişiselleştirmeyi başka bir aşamaya taşıdı. Peki bu ortamda kitle iletişimi tamamen öldü mü? Belki de buradaki asıl krizi erişimin azalması değil, ortak gerçekliği kuran sistemlerin giderek daha az hesap verebilir hâle gelmesi olarak okumalıyız.

Ümit Alan

·

03 Eki 2026

‘İletişimsiz kitle’ gerçeği: Herkese ulaşmak ama kimseyle buluşamamak
QuandoQuando
∙

HİKAYE

Mahremle kamusal arasında: Yapay zeka şirketleri tehditleri polise ne zaman bildirmeli?

Kanada’da bir okul saldırganının ChatGPT hesabının sekiz ay önce şiddet içerikli kullanım nedeniyle işaretlendiğinin ortaya çıkması, sohbet botlarının kullanıcılarını ne ölçüde izlemesi ve hangi noktada yetkililere bildirmesi gerektiği tartışmasını büyüttü. British Columbia’nın OpenAI’a karşı açtığı dava, mahremiyet ile güvenlik arasındaki sınırın nerede çizileceğini tartışmaya açarken Türkiye’de okul saldırıları sonrası alınan önlemler benzer bir sorunun başka bir yüzünü gösteriyor.

Ümit Alan

·

26 Eyl 2026

Mahremle kamusal arasında: Yapay zeka şirketleri tehditleri polise ne zaman bildirmeli?
QuandoQuando
∙

HİKAYE

Öne çıkan beş olasılık: Yapay zekayla ilgili felaket senaryoları neye odaklanıyor?

Yapay zekanın insanlığı yok edeceğine dair felaket senaryoları, genellikle kontrolden çıkan süper zekalara ve “katil robotlara” odaklanıyor. Oysa uzmanların daha olası gördüğü risklerin çoğunda yapay zeka tek başına hareket etmiyor. Özellikle beş olası senaryo, kontrol zincirini geri dönüşü olmayacak şekilde kırma potansiyeli taşıyor.

Doğa Yurduneri

·

23 Eyl 2026

Öne çıkan beş olasılık: Yapay zekayla ilgili felaket senaryoları neye odaklanıyor?
QuandoQuando
∙

HİKAYE

Teknolojide pazarlama soruları: Şirketlerle kullanıcılar neden aynı dili konuşamıyor?

Yapay zeka patlamasının da etkisiyle artık ürünlerin pazarlama materyallerinde sürekli aynı kelimeler tekrarlanıyor: Ajan tabanlı, AI destekli, kurumsal düzeyde, akıllı, uçtan uca, yeni nesil, ekosistem… Yıllar önce pazarlama ekiplerinin temel problemi, insanların üründen haberdar olmasını sağlamakken bugün bunun önünde çok daha kritik bir problem yer alıyor: İnsanların ürünün ne olduğunu anlamasını sağlamak.

Doğa Yurduneri

·

21 Eyl 2026

Teknolojide pazarlama soruları: Şirketlerle kullanıcılar neden aynı dili konuşamıyor?
QuandoQuando
∙

HİKAYE

AI yarışının Soğuk Savaş açmazı: Yapay zekanın gelişimini yavaşlatmak gerçekten mümkün mü?

Son birkaç yıldır yapay zeka yarışında geçerli olan kural basitti: Daha güçlü modeli daha hızlı geliştiren kazanır. Son günlerde sektörün öncü isimleri tarafından yapılan açıklamalar ise bu denklemin değişmeye başladığını gösteriyor. Modellerin siber saldırılardan biyolojik silah geliştirme girişimlerine uzanan riskli kullanım alanlarında sahneye çıkması, yarışın öncülerini ilk kez açık bir biçimde frene basma olasılığını tartışmaya itiyor.

Doğa Yurduneri

·

15 Eyl 2026

AI yarışının Soğuk Savaş açmazı: Yapay zekanın gelişimini yavaşlatmak gerçekten mümkün mü?