Görsel üreten yapay zeka uygulamaları yazmayı ne zaman öğrenecek?

QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
Yapay zeka matematik problemlerini çözebiliyor, kitap özetleri çıkarıp makale yazabiliyor, ressamlarla rekabete giriyor. Öte yandan özellikle görsel üreten versiyonlarının bir ilkokul çocuğundan fazla imla hatası yapma sorununa çare bulunamadı. Eğer Midjourney'den yaşlı bir adam portresi isterseniz, yüzündeki kırışıklıklardan gözündeki ifadeye, gerçeğinden ayırt etmesi zor bir görüntü üretebiliyor ama üzerinde yazı olan herhangi bir istekle karşılaştığında çuvallayıp, A'yla B'yi karıştırıyor.
Aynı durum, ChatGPT için de geçerli. ChatGPT şiir bile yazabiliyor, ama "İçinde A ve E harflerinin olmadığı 10 harfli bir kelime üretir misin?" diye sorulduğunda doğru cevap veremiyor. Örneğin bize "kömürleme" dedi; bunun içinde "e" harfi olduğunu hatırlattığımızda da özür dileyerek, "korunmaması" kelimesini önerdi.
Kibarlığı bir yana, bunun arkasında, yapay zeka modellerinin örüntülerle çalışması yatıyor. Metin oluşturan büyük dil modelleri, insan beyni gibi komutunuzu anlayıp onu yanıtlıyor gibi görünse de aslında komuttaki örüntüyü kompleks matematik yoluyla kendi latent alanındaki örüntüyle eşleştirip, bunu bir cevapla devam ettiriyor. Görüntü oluşturmak için kullanılan difüzyon modeli de verilen girdiyi yeniden inşa eden bir algoritmaya dayanıyor.
Her iki durumda da yapay zeka daha büyük örüntüleri öğrenirken harfler, yazılar gibi detaylar geri planda kalıyor. Bu algoritmalar, eğitim verilerinde gördüklerine benzer şeyleri yeniden üretebilirken bir kelimenin nasıl yazıldığı, insan elinin beş parmaklı olduğu gibi, insanların düşünmeden bildiği şeyler onlara yabancı olabiliyor. Geçen yıla kadar yapay zeka ile üretilen görsellerde fark edilen insan elleriyle ilgili sorunlar da imla hatalarıyla aynı nedene dayanıyor.
Mühendislerin veri setlerini geliştirip yapay zekaya insan elinin nasıl göründüğünü öğretecek eğitim modelleri oluşturması mümkün ama imla hatası yapmaması için bir eğitim modeli oluşturmak kolay bir iş değil.
Çünkü AI, örneğin "ip" kelimesini gördüğünde onun ne anlama geldiğini biliyor, ama "İ" ve "P"nin ne olduğuna dair bir fikri yok. Tabii, isterseniz "İ" harfinin tarihine ilişkin ayrıntılı bir ansiklopedi maddesi sunabilir.
Bu sorun karşısında Adobe Firefly gibi bazı modellere hiç metin üretmemeleri öğretiliyor. Örneğin "restoranda bir menü" gibi bir komut girdiğinizde, karşınıza yemek masasında boş bir kağıt çıkıyor. Ama yeterince ayrıntılı bir komutla insanlar bu engelleri aşabiliyorlar.
- Öte yandan: Tüm bunlar, yapay zekanın ürettiği imajların gerçeğinden ayırt edilemez hâle geldiği bir dünyada yaşamanın risklerini bertaraf etmek için de kullanılabilir. Böylece dikkatli bir şekilde inceleyerek endişe verici bir hızla gelişen yapay zekanın açıklarını yakalayabilirsiniz.
Kaydet
Okuma listesine ekle
Paylaş
QuandoHer salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
NEREDE YAYIMLANDI?
Görsel üreten AI modellerinin imla konusunda çuvallamasının nedenleri; Anthropic Claude 3 Opus'un GPT-4'ü Chatbot Arena'da mağlup edişi ve Birleşik Krallık'da yapay zeka nedeniyle yaklaşan istihdam krizi senaryoları Quando AI'da.
30 Mar 2024

YAZARLAR

Quando
Her salı ve cuma girişimcilik ve teknoloji ekosistemlerinden öne çıkan gelişmeler, paradigma değişimleri, inovasyon trendleri ve dijital dönüşüm e-posta kutunda.
İLGİLİ OKUMALAR
Gıda markaları, restoranlar ve kafeler, son dönemlerde giderek artan oranda yapay zeka üretimi görsellere başvuruyor. Fakat bu görseller, iştah açıcı görünmek yerine, “mide bulandıran” etkileriyle viral oluyorlar. Bu durum, dikkat çekici bir soruyu da gündeme taşıyor: Fotogerçekçi görüntüler üretme konusunda bu denli yetenekli hâle gelen yapay zeka modelleri, neden iştah açıcı yemek görselleri üretemiyor?

Türkiye, 15 yaş altına sosyal medya yasağını uygulamaya hazırlanırken yaş doğrulama için e-Devlet üzerinden token modeli gündemde. Çocukları sosyal medyanın zararlarından korumayı amaçlayan bu sistem, bütün kullanıcıların önce devletin kimlik altyapısından geçmesini gerektirebilir. Çocukları korumak amacıyla kurulan bu sistem, kullanıcıların kimliğiyle hesapları arasındaki bağı devletin elinde görünür hâle getirir mi? Yetişkinlerin anonimlik hakkı bundan nasıl etkilenecek?

Apple, her yıl Eylül ayında düzenlediği geleneksel lansman etkinliğini bu yıl 9 Eylül Çarşamba günü “Sürpriz ve Parıltı” sloganıyla hayata geçirdi. Etkinlikte ilk katlanabilir iPhone modeli iPhone Duo’nun yanı sıra iPhone 18 Pro, iPhone 18 Pro Max, Apple Watch Series 12, Apple Watch Ultra 4 ve AirPods 5 de tanıtıldı. Şirket ayrıca, en yeni mobil işletim sistemi sürümü iOS 27’nin çıkış tarihini de duyurdu.

Bugün artık pek çok şirket, verilerinin kontrollü bir ortamda kalması için çalışanlarına kurumsal bir yapay zeka hesabı sağlıyor. Fakat çalışanlar, bir sunum hazırlarken ChatGPT'yi, toplantı notlarını toparlarken Claude'u ya da raporlardaki verileri görselleştirirken Gemini’ı kullanmayı tercih edebiliyor. Daha pratik bulunduğu için kişisel bir hesap üzerinden yapay zekaya yüklenen bir dosya, şirket içi finansal veriler ya da müşteri bilgilerini içeriyorsa bir anda şirketin en büyük kör noktalarından birine dönüşebiliyor.

Artırılmış gerçeklik (AR), tüketici pazarında hâlâ kitlesel olarak benimsenmenin yollarını ararken teknolojinin asıl etkisi çok daha kritik kullanım alanlarında ortaya çıkıyor. Duygu Daniels, itfaiyecilerin görüş mesafelerinin sıfıra düştüğü ortamlarda yollarını bulmalarına yardımcı olan AR teknolojileri geliştiren Ömer Hacıömeroğlu ile AR’ın bugünkü kullanım alanlarını, yapay zekayla kesişimini ve geleceğini konuştu.



