Beş saniyede ses klonlamak

Favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin arka planı.
Beş saniyede ses klonlamak

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

Scream (Çığlık) serisindeki yeriyle dikkatimizi çekmiş olan "ses değiştirme" teknolojisi 2000’lerin başında biraz fütürist kaldığı için unutulmuştu. Yapay zekânın toplum nezdinde yeri de Terminatör filmlerindeki aksiyon dolu profilden nötr ve gündelik hayatı kolaylaştıran bir teknoloji kavramına gelişince bu iki teknolojinin birleşmesi "ses değiştirme" ya da daha doğru bir yaklaşımla "ses taklit etme" teknolojisinin hayatımıza yeniden girmesini sağladı. 

  • Cornell Üniversitesi'nin bilgisayar bilimleri departmanı tarafından yayımlanan iki makalenin pratik denemeleri, yapay zekâ tabanlı sistemin bir sesi sadece beş saniye dinleyerek klonlamasına olanak sağladı. Hâlihazırda belli seviyede gelişmiş olan ses klonlama teknolojisi çeşitli örnekleriyle beraber telefon uygulamalarında ve özel yapım videolarda yer almıştı
     
  • Neden Ünlüler? Ses klonlama teknolojisinin temelinde yapay zekâ yatıyor (evet doğru bildiniz). Yapay zekâ çok geniş bir konsept adı olmasının yanında makine öğrenmesi modeli, temel olarak bir bilgisayarın büyük hacimli verileri alması ve bir metodolojiye bağlı kalarak işlemesinden ibaret. Dolayısıyla bir modelin istenen veya tarif edilen bir işi yüksek verimle gerçekleştirmesi için çok sayıda örnek veriye ihtiyacı var. Tam da bu yüzden bir ünlünün filmlerdeki replikleri, söylediği şarkılar, televizyondan yayımlanmış olan röportajlar ve Youtube gibi kaynaklarda bulunan içerikleri o kişinin sesini; klonlamak için benzersiz bir aday hâline getiriyor. 
     
  • Normalde saatlerce süren ses kayıtlarıyla gerçekleştirilebilen bu klonlama işleminin beş saniyeye kadar inmesinin arkasında yatan metodoloji ise şimdiye kadar toplanmış verilerin sağladığı ses tanıma fonksiyonunun geri beslemeyle verimli bir şekilde yapılanmasına dayanıyor. Yazıdan ses üretimini yapay sinir ağlarını kullanarak oluşturan araştırmacılar, modelin kendisine daha önce öğretilmemiş olan sesleri de algıladıktan sonra konuşma yaratabildiğini belirtiyor. Bunu birbirinden bağımsız üç içerik ile mümkün kılıyorlar
     
  • WaveNet: DeepMind yapay zekâ şirketi tarafından geliştirilen ham ses oluşturucusu. Yapay sinir ağları, verilen dalga şekilleriyle oynayarak gerçekte var olmayan seslerin geliştirilmesini sağlıyor
     
  • Spektrogram: Ses bilgisinin grafiksel gösterimi.
     
  • Birbirinden bağımsız gürültülü seslerden oluşan veri setinin işlenerek bir konuşmacı doğrulama görevi üzerine eğitilmesi sonucu hedeften alınan konuşmayı saniyeler içerisinde referans hâle getirmeye yarayan kodlayıcı ağ sistemi.
     
  • Girilen metinlerden bir spektrogram oluşturan, verilen sesi diziden diziye sentezleyen ağ sistemi.
     
  • Spektrogram üzerinden alınan bilgiyi ses dalgasına dönüştüren kendiliğinden öğrenmesini pekiştiren WaveNet tabanlı ses kodlayıcı.
     
  • Bu üç yapının birbiriyle bağlantısı sonucu oluşan sistem, ilk olarak dinlediği beş saniyelik sesi daha önce dinlediği seslerle ve öğrendiği nüanslarla karşılaştırıyor. Bu eşleşme sonrasında elde edilen uygun denkliklerden yola çıkarak benzer seslerin "fotoğrafları" en doğru model oluşturuluyor. Sesin söylemesi istenen yazı da yine daha önceki ses fotoğraflarından öğrenilerek yeni sese adapte ediliyor. Sonuç olarak da sadece beş saniyelik bilgi zenginleştirilmiş bir verimle çok sayıda cümleyi seslendirebilir hâle geliyor. 
     
  • İşte şimdi; favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin, sesinizi başkalarına hediye edebilmenizin veya telefonda en yakın arkadaşınız sandığınız kişinin aslında başka biri çıkmasının sebebini biliyorsunuz!
Hikâyeyi paylaşmak için:

Kaydet

Okuma listesine ekle

Paylaş

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

NEREDE YAYIMLANDI?

QuandoQuando

BÜLTEN SAYISI

📠 Kaba AI ve çocuk hacker

Bu sayımızda yapay zekânın kabalığını, Twitter #hack’ini gerçekleştiren Ivan’ın sosyal mühendisliğini ve beş saniyede ses klonlamayı ele aldık.

13 Ağu 2020

📠 Kaba AI ve çocuk hacker

YAZARLAR

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

İLGİLİ OKUMALAR

QuandoQuando

HİKAYE

AI yarışının Soğuk Savaş açmazı: Yapay zekanın gelişimini yavaşlatmak gerçekten mümkün mü?

Son birkaç yıldır yapay zeka yarışında geçerli olan kural basitti: Daha güçlü modeli daha hızlı geliştiren kazanır. Son günlerde sektörün öncü isimleri tarafından yapılan açıklamalar ise bu denklemin değişmeye başladığını gösteriyor. Modellerin siber saldırılardan biyolojik silah geliştirme girişimlerine uzanan riskli kullanım alanlarında sahneye çıkması, yarışın öncülerini ilk kez açık bir biçimde frene basma olasılığını tartışmaya itiyor.

Doğa Yurduneri

·

15 Eyl 2026

AI yarışının Soğuk Savaş açmazı: Yapay zekanın gelişimini yavaşlatmak gerçekten mümkün mü?
QuandoQuando

HİKAYE

Jeff Sebo ile bilinç, risk ve sorumluluk üzerine: 'Sihirli bir değneğim olsa yapay zekayı olduğu yerde dondururdum'

Yapay zeka yarışını yavaşlatma çağrıları teknoloji şirketlerinin içinden de yükselirken, New York Üniversitesi’nden filozof Jeff Sebo ile yapay zekanın risklerini, bilinç ihtimalini, hayvan refahını ve gelecekte dijital zihinlere karşı doğabilecek sorumluluklarımızı konuştuk.

Çiğdem Öztabak

·

14 Eyl 2026

Jeff Sebo ile bilinç, risk ve sorumluluk üzerine: 'Sihirli bir değneğim olsa yapay zekayı olduğu yerde dondururdum'
QuandoQuando

HİKAYE

AI destekli menü furyası: Yapay zeka neden iştah açıcı yemek görselleri üretemiyor?

Gıda markaları, restoranlar ve kafeler, son dönemlerde giderek artan oranda yapay zeka üretimi görsellere başvuruyor. Fakat bu görseller, iştah açıcı görünmek yerine, “mide bulandıran” etkileriyle viral oluyorlar. Bu durum, dikkat çekici bir soruyu da gündeme taşıyor: Fotogerçekçi görüntüler üretme konusunda bu denli yetenekli hâle gelen yapay zeka modelleri, neden iştah açıcı yemek görselleri üretemiyor?

Doğa Yurduneri

·

13 Eyl 2026

AI destekli menü furyası: Yapay zeka neden iştah açıcı yemek görselleri üretemiyor?
QuandoQuando

HİKAYE

Çocuğa yasak, yetişkine kontrol: Anonim internetin sonbaharına mı girdik?

Türkiye, 15 yaş altına sosyal medya yasağını uygulamaya hazırlanırken yaş doğrulama için e-Devlet üzerinden token modeli gündemde. Çocukları sosyal medyanın zararlarından korumayı amaçlayan bu sistem, bütün kullanıcıların önce devletin kimlik altyapısından geçmesini gerektirebilir. Çocukları korumak amacıyla kurulan bu sistem, kullanıcıların kimliğiyle hesapları arasındaki bağı devletin elinde görünür hâle getirir mi? Yetişkinlerin anonimlik hakkı bundan nasıl etkilenecek?

Ümit Alan

·

11 Eyl 2026

Çocuğa yasak, yetişkine kontrol: Anonim internetin sonbaharına mı girdik?
QuandoQuando

HİKAYE

Apple lansmanından öne çıkanlar: iPhone Duo ve iPhone 18 Pro modelleri tanıtıldı

Apple, her yıl Eylül ayında düzenlediği geleneksel lansman etkinliğini bu yıl 9 Eylül Çarşamba günü “Sürpriz ve Parıltı” sloganıyla hayata geçirdi. Etkinlikte ilk katlanabilir iPhone modeli iPhone Duo’nun yanı sıra iPhone 18 Pro, iPhone 18 Pro Max, Apple Watch Series 12, Apple Watch Ultra 4 ve AirPods 5 de tanıtıldı. Şirket ayrıca, en yeni mobil işletim sistemi sürümü iOS 27’nin çıkış tarihini de duyurdu.

Doğa Yurduneri

·

09 Eyl 2026

Apple lansmanından öne çıkanlar: iPhone Duo ve iPhone 18 Pro modelleri tanıtıldı