Beş saniyede ses klonlamak

Favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin arka planı.
Beş saniyede ses klonlamak

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

Scream (Çığlık) serisindeki yeriyle dikkatimizi çekmiş olan "ses değiştirme" teknolojisi 2000’lerin başında biraz fütürist kaldığı için unutulmuştu. Yapay zekânın toplum nezdinde yeri de Terminatör filmlerindeki aksiyon dolu profilden nötr ve gündelik hayatı kolaylaştıran bir teknoloji kavramına gelişince bu iki teknolojinin birleşmesi "ses değiştirme" ya da daha doğru bir yaklaşımla "ses taklit etme" teknolojisinin hayatımıza yeniden girmesini sağladı. 

  • Cornell Üniversitesi'nin bilgisayar bilimleri departmanı tarafından yayımlanan iki makalenin pratik denemeleri, yapay zekâ tabanlı sistemin bir sesi sadece beş saniye dinleyerek klonlamasına olanak sağladı. Hâlihazırda belli seviyede gelişmiş olan ses klonlama teknolojisi çeşitli örnekleriyle beraber telefon uygulamalarında ve özel yapım videolarda yer almıştı
     
  • Neden Ünlüler? Ses klonlama teknolojisinin temelinde yapay zekâ yatıyor (evet doğru bildiniz). Yapay zekâ çok geniş bir konsept adı olmasının yanında makine öğrenmesi modeli, temel olarak bir bilgisayarın büyük hacimli verileri alması ve bir metodolojiye bağlı kalarak işlemesinden ibaret. Dolayısıyla bir modelin istenen veya tarif edilen bir işi yüksek verimle gerçekleştirmesi için çok sayıda örnek veriye ihtiyacı var. Tam da bu yüzden bir ünlünün filmlerdeki replikleri, söylediği şarkılar, televizyondan yayımlanmış olan röportajlar ve Youtube gibi kaynaklarda bulunan içerikleri o kişinin sesini; klonlamak için benzersiz bir aday hâline getiriyor. 
     
  • Normalde saatlerce süren ses kayıtlarıyla gerçekleştirilebilen bu klonlama işleminin beş saniyeye kadar inmesinin arkasında yatan metodoloji ise şimdiye kadar toplanmış verilerin sağladığı ses tanıma fonksiyonunun geri beslemeyle verimli bir şekilde yapılanmasına dayanıyor. Yazıdan ses üretimini yapay sinir ağlarını kullanarak oluşturan araştırmacılar, modelin kendisine daha önce öğretilmemiş olan sesleri de algıladıktan sonra konuşma yaratabildiğini belirtiyor. Bunu birbirinden bağımsız üç içerik ile mümkün kılıyorlar
     
  • WaveNet: DeepMind yapay zekâ şirketi tarafından geliştirilen ham ses oluşturucusu. Yapay sinir ağları, verilen dalga şekilleriyle oynayarak gerçekte var olmayan seslerin geliştirilmesini sağlıyor
     
  • Spektrogram: Ses bilgisinin grafiksel gösterimi.
     
  • Birbirinden bağımsız gürültülü seslerden oluşan veri setinin işlenerek bir konuşmacı doğrulama görevi üzerine eğitilmesi sonucu hedeften alınan konuşmayı saniyeler içerisinde referans hâle getirmeye yarayan kodlayıcı ağ sistemi.
     
  • Girilen metinlerden bir spektrogram oluşturan, verilen sesi diziden diziye sentezleyen ağ sistemi.
     
  • Spektrogram üzerinden alınan bilgiyi ses dalgasına dönüştüren kendiliğinden öğrenmesini pekiştiren WaveNet tabanlı ses kodlayıcı.
     
  • Bu üç yapının birbiriyle bağlantısı sonucu oluşan sistem, ilk olarak dinlediği beş saniyelik sesi daha önce dinlediği seslerle ve öğrendiği nüanslarla karşılaştırıyor. Bu eşleşme sonrasında elde edilen uygun denkliklerden yola çıkarak benzer seslerin "fotoğrafları" en doğru model oluşturuluyor. Sesin söylemesi istenen yazı da yine daha önceki ses fotoğraflarından öğrenilerek yeni sese adapte ediliyor. Sonuç olarak da sadece beş saniyelik bilgi zenginleştirilmiş bir verimle çok sayıda cümleyi seslendirebilir hâle geliyor. 
     
  • İşte şimdi; favori şarkıcınızın sesiyle arkadaşlarınızı arayıp şarkı söyleyebilmenizin, sesinizi başkalarına hediye edebilmenizin veya telefonda en yakın arkadaşınız sandığınız kişinin aslında başka biri çıkmasının sebebini biliyorsunuz!
Hikâyeyi paylaşmak için:

Kaydet

Okuma listesine ekle

Paylaş

Quando

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

NEREDE YAYIMLANDI?

QuandoQuando

BÜLTEN SAYISI

📠 Kaba AI ve çocuk hacker

Bu sayımızda yapay zekânın kabalığını, Twitter #hack’ini gerçekleştiren Ivan’ın sosyal mühendisliğini ve beş saniyede ses klonlamayı ele aldık.

13 Ağu 2020

📠 Kaba AI ve çocuk hacker

YAZARLAR

Quando

Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.

İLGİLİ OKUMALAR

QuandoQuando

HİKAYE

Yuval Noah Harari'den AI ve geleceğimiz: Şişedeki cinden ne isteyeceğimizi bilecek kadar bilge olabilecek miyiz?

Tarihçi ve yazar Yuval Noah Harari, gazeteci Tom Parker’a verdiği röportajda yapay zekayı karar verebilen ve yeni fikirler üretebilen bir “yabancı zeka” olarak tanımlıyor. İnsanlığın dil üzerindeki hakimiyetini bu yeni aktörle paylaşmasının güç dengelerini nasıl değiştireceğini sorgulayan Harari, zeka ile bilgelik arasındaki ayrıma odaklanıyor: Zeka ucuzlayıp bollaşırken insanlık, ne isteyeceğini bilecek kadar bilge olabilecek mi?

Çiğdem Öztabak

·

26 Ağu 2026

Yuval Noah Harari'den AI ve geleceğimiz: Şişedeki cinden ne isteyeceğimizi bilecek kadar bilge olabilecek miyiz?
QuandoQuando

HİKAYE

Big Tobacco’dan Big Tech’e: Meta davası sosyal medyayı değiştirebilir mi?

1990’larda ABD’de tütün şirketlerine açılan davalar, sigara endüstrisinin reklam ve pazarlama pratiklerini de kökünden değiştirmişti. Aradan 30 yıldan uzun bir süre geçti. Şimdi benzer bir tartışma 29 eyaletin Meta’yı Facebook ve Instagram’ı çocukları platformda tutacak biçimde tasarlamak ve riskleri kamuoyundan gizlemekle suçladığı davada yeniden gündeme geliyor. Davanın önemi ise sosyal medyanın temel tasarımını ve reklam modelini değiştirebilecek olmasında yatıyor.

Doğa Yurduneri

·

26 Ağu 2026

Big Tobacco’dan Big Tech’e: Meta davası sosyal medyayı değiştirebilir mi?
QuandoQuando

HİKAYE

Kullandığınız emojiler yaşınızı ele veriyor olabilir: Hangi kuşak nasıl gülüyor?

Emojiler, ilk bakışta internet ekosisteminin evrensel bir dili gibi görünse de hangi emojiyi kullandığınız, sizinle ilgili sandığınızdan çok daha fazla şey söylüyor. Bazen bir emoji, doğum tarihinizi yazmanıza gerek kalmadan hangi kuşağa ait olduğunuzu rahatlıkla ele verebiliyor.

Doğa Yurduneri

·

24 Ağu 2026

Kullandığınız emojiler yaşınızı ele veriyor olabilir: Hangi kuşak nasıl gülüyor?
QuandoQuando

HİKAYE

Yapay Zeka Eylem Planı: Hedefler dönüşümün hızına yetişiyor mu?

Haziran ayında İstanbul’daki Türkiye Yapay Zeka Zirvesi’nde açıklanan 2026-2030 Türkiye Yapay Zeka Eylem Planı, Resmî Gazete’de yayımlanmasıyla kamu kurumları için resmî bir yol haritasına dönüştü. Plan, yetkinliklerin yaygınlaştırılmasından işlem gücü yatırımlarına uzanan 16 adımlık bir çerçeve sunuyor ancak sınırlı eğitim hedefleri, özel sektöre yönelik teşvik ihtiyacı, yönetişim ve çevre alanındaki boşluklar, planın geliştirilebilecek yönlerine işaret ediyor.

Umutcan Savcı

·

19 Ağu 2026

Yapay Zeka Eylem Planı: Hedefler dönüşümün hızına yetişiyor mu?
QuandoQuando

HİKAYE

Hız tartışmaları ve etik çatışmalar: Google’ın AI yönetimindeki değişimin perde arkası

Google, yapay zeka alanında bugüne dek her zaman sessiz, istikrarlı, kendini kanıtlamış ve olgun bir şirket imajı çizdi. Fakat Ağustos ayı başlarında şirket, yapay zeka yönetiminde bugüne kadar yaptığı en köklü değişikliklerden birine gitti. Eski şirket çalışanları tarafından yapılan açıklamalar, bu yönetim değişikliğinin ardında şirketin yapay zeka alanında hangi yöne ilerlemesi gerektiğine dair önemli bir fikir ayrılığı olabileceğine işaret etti.

Doğa Yurduneri

·

19 Ağu 2026

Hız tartışmaları ve etik çatışmalar: Google’ın AI yönetimindeki değişimin perde arkası