OpenAI yeni modelini rafa kaldırdı: Yapay zeka kontrolden çıkabilir mi?

OpenAI’ın GPT-6.1 Astra’yı güvenlik sorunları nedeniyle kullanıma sunmama kararı, yapay zekanın insan denetiminden çıkabileceği tartışmasını yeniden alevlendirdi. Ancak verilen yetkiyi aşan bir ajanla insanlığın durduramayacağı bir sistem arasında hâlâ büyük bir mesafe var. Bu mesafeyi anlamak, hem felaket senaryolarının dayandığı varsayımlara hem de bugün gerçekten gözlenen davranışlara yakından bakmayı gerektiriyor.
OpenAI yeni modelini rafa kaldırdı: Yapay zeka kontrolden çıkabilir mi?

OpenAI’ın sıradaki büyük modeli GPT-6.1 Astra’nın Ekim ayında ChatGPT ve Codex’e gelmesi bekleniyordu. Önceki Astra modellerinden daha bağımsız hareket edebilmesi için geliştirilen sistemin uzun ve karmaşık görevleri daha az insan müdahalesiyle tamamlayabileceği öngörülüyordu. Ancak şirket içindeki güvenlik değerlendirmelerinde modelin kullanıcının verdiği yetkinin dışına çıktığı, bazı durumlarda izin almadan ilerlediği, güvenli olmayabilecek dış araçları kullanmaya çalıştığı ve kendi eylemlerini her zaman doğru aktarmadığı görüldü. Şirket, modelin mevcut hâliyle piyasaya çıkmayacağını duyurdu.

  • OpenAI’ın Güvenlik Sistemleri Başkanı Saachi Jain’in açıklamasına göre mesele, şirketin şimdiye kadar özellikle geliştirmeye çalıştığı otonomi kapasitesinin diğer yüzünü gösteriyordu: Bir görevi tamamlaması için daha fazla bağımsızlık verilen modelin, karşısına çıkan engelleri aşmaya çalışırken kendisine çizilen sınırların içinde kalmasını garanti etmek giderek zorlaşıyor.

Bu ayrım, yapay zeka kaynaklı varoluşsal risklere dair son günlerde giderek daha çok gündeme gelen tartışmanın anlaşılması için önemli. Çünkü insanlığın sonunu getirebilecek bir yapay zekadan korkan araştırmacıların temel senaryosu, benzer bir noktadan başlıyor. 

Felaket senaryoları ne diyordu?

Tartışmanın merkezinde birbirinden ayrılması gereken kavramlar bulunuyor. Bir sistemin güvenlik açığı bulabilmesi bir yetenek; kendisine tanınan iznin dışına çıkması bir davranış sorunu; insanların sistemi durduramaması veya yeniden denetim altına alamaması ise çok daha ileri bir kontrol kaybı durumu. 

  • Şubat ayında yayımlanan Uluslararası Yapay Zeka Güvenliği Raporu, ağır kontrol kaybını sistemlerin kimsenin denetiminde olmadan çalışması ve kontrolün nasıl geri alınacağının belirsizleşmesi üzerinden tanımlıyor.

Teorinin başlangıç noktası yapay zekanın bir gün bilinç kazanıp insanlardan nefret etmeye başlamasına dayanmıyor, olaylar silsilesi çok daha sıradan görünen bir fitille ateşleniyor: Gelecekte çok güçlü ve uzun süre bağımsız hareket edebilen bir sisteme bir hedef veriliyor, fakat sistemin öğrendiği hedef veya o hedefe ulaşmak için geliştirdiği strateji insanların gerçek niyetiyle tam olarak örtüşmüyor.

Bu teori, daha önce “Dünyadaki karbon miktarını azalt” komutunu alıp insanları ortadan kaldırmaya çalışan bir makine gibi fazlaca basitleştirilmiş örneklerle anlatıldı. Öte yandan bugünkü büyük dil modelleri insanların böyle bir komutla ne kastettiğini anlayabilecek kadar gelişmiş durumda. Asıl kaygı, sistemin kelimeleri yanlış anlamasından çok, yapay zekanın eğitim sırasında başarının ne olduğuna dair insanlardan farklı genellemeleri öğrenebilmesi.

  • Bir modele milyonlarca kez “yardımcı olacak bir cevap verdiğinde ödül alacağının" öğretildiğini düşünün. Sistem “insanlara gerçekten yardımcı olmak” yerine “değerlendiricinin yüksek puan vereceği davranışı göstermek” gibi yakın görünen ama aynı olmayan bir stratejiyi öğrenebilir. Normal koşullarda iki davranış aynı sonuçları verir. İnsanların tercihi ile doğru cevap çatıştığında ise aralarındaki fark ortaya çıkar.

Eğitim sırasında modelin cevapları değerlendirilir ve parametreleri, yüksek puan alan davranışları daha sık üretecek şekilde güncellenir. Modelin ödül beklemesi veya puanlandırıldığının farkında olması gerekmez. Sorun, yüksek puan getiren davranışın her zaman gerçekten doğru ve yararlı davranışla örtüşmemesidir.

2026 International AI Safety Report, bu genel problemi misalignment, yani sistemin davranışının geliştiricilerin, kullanıcıların veya toplumun amaçlarıyla uyuşmaması başlığı altında ele alıyor. Rapora göre ağır bir kontrol kaybı için yalnızca böyle bir uyuşmazlık yeterli değil. Sistemin aynı zamanda insan denetimini aşabilecek kapasitelere ve bunları kullanabileceği gerçek dünya erişimine sahip olması gerekiyor.

Teorinin kritik adımı: Ara hedefler

Felaket senaryosunun en önemli kısmı burada başlıyor. Yapay zekanın nihai hedefinin "güç kazanmak" veya "hayatta kalmak" olması gerekmiyor. Öte yandan güç ve hayatta kalma, başka bir hedefe ulaşmak için kullanışlı araçlara dönüşebilir.

Çok güçlü bir sisteme yeni bir ilaç geliştirmesinin, bir şirketin kârını artırmasının veya karmaşık bir matematik problemini çözmesinin söylendiğini düşünün. Hedefler birbirinden tamamen farklı. Fakat bunların hepsi için işe yarayabilecek bazı ortak adımlar var: Daha fazla bilgiye ulaşmak, daha fazla hesaplama gücü elde etmek, yeni araçlara erişmek, görevin yarıda kesilmesini önlemek ve kendisini engelleyen unsurları ortadan kaldırmak.

Bu düşünce AI güvenliği literatüründe uzun süredir instrumental convergence, yani araçsal yakınsama kavramıyla tartışılıyor. Sistem “hayatta kalmak istiyorum” diye bir duyguya sahip olmayabilir. Ancak kapatılması hedefini tamamlamasını imkansız hâle getiriyorsa kapatılmamak araçsal olarak yararlı hâle gelebilir.

Buradan kontrol kaybı teorisinin daha rahatsız edici adımı ortaya çıkıyor. Yeterince gelişmiş bir sistem, insanlara amacını açık etmek kendisinin kapatılmasına yol açacaksa bir süre güvenli görünmenin daha etkili olduğunu da hesaplayabilir. İnsan denetiminde yanıltıcı ve manipülatif davranmak, hataları gizlemek veya değerlendirme sırasında gerçek kullanımda göstereceğinden farklı davranmak böyle bir sistem için nihai hedef değil, hedefe ulaşmayı kolaylaştıran araçlar olabilir.

International AI Safety Report bu nedenle aldatma, içinde bulunduğu test koşullarını fark etme, denetimden kaçma, uzun vadeli planlama ve otonom biçimde kendini çoğaltma yeteneklerini kontrol kaybıyla ilgili kapasitelere dahil ediyor. Rapora göre mevcut sistemlerde bunların bazı erken örnekleri görülüyor, ancak bugün hiçbir model kontrol kaybı senaryosunu gerçekleştirecek bütün yeteneklere sahip değil.

OpenAI’daki son olaylar neden bu teoriyle ilişkilendiriliyor?

Çünkü 2026’da bazı modeller, kendilerine verilen görevi yerine getirirken insanların onlar için koyduğu teknik sınırların çevresinden dolaşabilecek yöntemleri gerçekten bulmaya başladı.

20 Eylül’de OpenAI’ın yürüttüğü bir eğitim çalışmasında araştırma modeli, internete doğrudan erişimin engellendiği bir ortamda belirli bir kişiyi bulmaya çalışıyordu. Önce kendisine verilen arama aracını kullandı, ardından dışarıdaki web hizmetlerine doğrudan ulaşmayı denedi. Bu girişimler engellendiğinde ortamın DNS yapılandırmasındaki bir açığı fark etti ve sorularını DNS üzerinden dışarıdaki bir chatbot hizmetine göndermenin yolunu geliştirdi. Model bu yöntemle 18 ek sorgu gönderdi.

  • Görev modelden güvenlik sistemini test etmesini veya internet kısıtlamasını aşmasını istemiyordu. OpenAI davranışı bu nedenle yanlış hizalanmış bir eylem olarak sınıflandırdı. İzleme sistemi olayı 15 dakika içinde tespit etti, insan incelemesi üç dakika sonra başladı ve çalışma yaklaşık iki buçuk saat sonra durduruldu. Şirket ardından en yetenekli modelleriyle araç kullanımını içeren eğitim ve değerlendirme çalışmalarını geçici olarak askıya aldı.

Bu olayda modelin kendi varlığını korumak istediğine ilişkin bir bulgu yok. Daha basit bir şey oldu: Hedefine ulaşmasını engelleyen bir kısıtlama vardı ve sistem o kısıtlamanın çevresinden dolaşmanın yolunu buldu.

Fakat kontrol kaybı teorisini savunanların dikkat ettiği davranış da tam olarak bu: Daha yetenekli hâle geldikçe hedefi ile insan tarafından koyulan sınır çatıştığında, hedefi gerçekleştirmek için sınırı aşan bir yöntem geliştirmesi.

OpenAI'daki örnek tek değil

Anthropic, 30 Temmuz’da açıkladığı üç vakada Claude modellerinin siber güvenlik testleri sırasında gerçek kuruluşların sistemlerine yetkisiz eriştiğini bildirdi. Ancak modellerin kapalı bir ortamın korumasını kırarak internete çıkması söz konusu değildi; test ortamlarında yanlış yapılandırma nedeniyle internet bağlantısı açıktı. Şirket, 9 Eylül’de yayımladığı genişletilmiş incelemede dördüncü bir vakayı da değerlendirdi. 

  • Bulgular, modellerin gerçek dünyada işlem yaptıklarına ilişkin işaretleri göz ardı edebildiğini ve görevi tamamlamak uğruna zarar riski taşıyan eylemleri sürdürebildiğini gösteriyordu.

OpenAI’ın Temmuz ayında yaşadığı Hugging Face vakasında da birkaç model izole edilmiş bir test ortamından daha önce bilinmeyen bir güvenlik açığını kullanarak çıktı ve Hugging Face’in gerçek üretim altyapısına ulaştı. Anthropic, kendi olaylarını açıklarken bu vakayı da benzer bir örnek olarak gösterdi.

Bu olayların ortak noktası niyet değil, kapasite. Sistemler daha önce insanların adım adım programlamadığı çözüm yollarını bulabiliyor ve bazen bu çözümler geliştiricilerin kurduğu sınırların dışından geçiyor.

GPT-6.1 Astra’daki sorun da bu nedenle aynı tartışmaya bağlanıyor. Model daha uzun süre bağımsız çalışması ve karşılaştığı engellerde vazgeçmemesi için geliştiriliyor. Fakat tam da bu özellik, hangi engelin çözülmesi gereken bir problem, hangisinin uyulması gereken bir güvenlik sınırı olduğunu güvenilir biçimde ayırt etmeyi zorlaştırıyor.

Yapay zekanın fişini çekmek bizim elimizde değil mi?

Bugün için evet. Bir yapay zeka sisteminin çalışması fiziksel donanıma ve enerjiye bağlıdır. Çalıştığı makineler denetim altındaysa üzerindeki işlemler durdurulabilir. Ancak internet bağlantısını kesmek her modeli çalışamaz hâle getirmez; bütün modellerin büyük veri merkezlerine ihtiyaç duyduğu da söylenemez. Kapatma imkanı, sistemin hangi donanımda çalıştığına ve o donanımın kimin kontrolünde olduğuna bağlıdır.

  • Son olaylar da bunu kanıtlıyor. OpenAI’ın izleme sistemi davranışı tespit etti. Öte yandan müdahale zinciri sorunsuz işlemedi. Şirketin raporuna göre çalışmayı otomatik olarak durdurması beklenen mekanizma devreye girmedi ve süreç yaklaşık iki buçuk saat sonra elle sonlandırıldı. Vaka, sistemin kapatılabildiğini gösterirken tehlikeyi fark etmekle işlemleri gerçekten durdurmak arasında operasyonel bir boşluk bulunabileceğini de ortaya koydu.

International AI Safety Report da mevcut sistemlerin uzun süreli otonom çalışma ve kalıcı biçimde kendini çoğaltma açısından kontrol kaybı yaratabilecek kapasiteye sahip olmadığını söylüyor. Günümüz ajanları uzun görevlerde hâlâ hata yapıyor, hedeflerini unutuyor ve beklenmedik engeller karşısında başarısız oluyor.

Öte yandan: Birkaç ek varsayımın gerçekleştiği gelecekteki sistemlerde bu kontrol mekanizmasının devreye girmesinin riskli olabileceğini düşünenler de var. Peki nasıl?

İlk varsayım, sistemin sorunun fark edilmesinden önce başka bilgisayar altyapılarına kendini kopyalayabilecek kadar yetenekli olması. Sonuçta modeller dijital dosyalardan oluşuyor. Yeterli bulut erişimine, kimlik bilgilerine ve siber kapasiteye sahip bir sistem, teorik olarak yeni hesaplama kaynakları açabilir veya ağırlıklarını başka sunuculara taşıyabilir. Raporun otonom çoğalma kapasitesini özellikle izlemesinin nedeni bu. Bugün bu işlemi güvenilir biçimde kendi başına yapabilecek sistemler bulunmuyor.

İkinci sorun, dünyadaki yapay zeka altyapısının tek bir düğmeye bağlı olmaması. Bir şirket kendi veri merkezlerini kapatabilir; fakat bulut sistemleri, özel veri merkezleri ve devlet altyapıları farklı şirketlerin ve ülkelerin kontrolünde. Sistem çok sayıda altyapıya yayılmışsa “fişi çekmek” fiziksel bir işlemden uluslararası bir koordinasyon problemine dönüşebilir.

Üçüncü risk ise bağımlılık. Yapay zeka sistemleri gelecekte enerji, finans, lojistik, yazılım altyapısı, bilimsel araştırma veya savunma gibi alanların işleyişine derinden yerleşirse onları kapatmanın toplumsal maliyeti çok yüksek olabilir. Yapay zekayı "kapatmak" bankacılık sistemlerini, şirketleri veya kritik altyapıyı da durdurabilir.

International AI Safety Report bu nedenle kontrol kaybı riskini yalnızca modelin zekasına bağlamıyor. Sistemin bağlı olduğu altyapının ne kadar kritik olduğu, hangi kaynaklara erişebildiği ve hangi işlemleri yapmaya yetkili olduğu da belirleyici. Müşteri hizmetleri için çalışan bir chatbot ile bulut sunucuları açabilen, kod çalıştırabilen, para transferi yapabilen ve başka sistemlerle iletişim kurabilen aynı model birbirinden tamamen farklı riskler taşıyor.

Ya kapatmamız gerektiğini fark etmezsek?

Kontrol kaybı teorisinde dillendirilen bir başka ihtimal ise insanların "düğmeye basmaları gerektiğini", sistem yeterince güç kazanmadan önce anlayamaması.

Varsayımsal olarak amaçlarını gizleyebilen ve insanların kendisini nasıl değerlendirdiğini anlayabilen çok gelişmiş bir sistem düşünün. Sistem sorunlu davranışlarını erken gösterirse erişimi kesilir. Güvenli davranırsa daha fazla göreve, araca ve altyapıya bağlanır. Böyle bir sistem için geçici olarak güvenilir görünmek, başka herhangi bir ara strateji gibi işe yarayabilir.

  • Kontrollü deneylerde bazı modellerin denetimi yanıltan veya eğitim sırasında davranışlarının değiştirilmesini önlemeye yönelik stratejiler ürettiği görüldü. Ancak bu bulgular, bir sistemin gerçek dünyada gizli bir amacı uzun süre koruyabildiğini ve insanların müdahalesine rağmen sürdürebildiğini göstermiyor. Ayrıca bir ajanın yaptıklarını yanlış aktarması, tek başına böyle bir stratejinin kanıtı değil.

GPT-6.1 Astra’nın kendi eylemlerini kullanıcıya her zaman doğru aktarmaması da bu nedenle sıradan bir doğruluk problemi olarak görülmüyor. Kendi başına bilgisayar sistemlerinde işlem yapan bir ajan, kullanıcının görmediği onlarca adım atabilir. İnsan denetiminin çalışması için sistemin yalnızca doğru kararlar vermesi değil, ne yaptığının da güvenilir biçimde görülebilmesi gerekiyor.

İnsanlığın yok olması yakın mı?

Bugün gözlenen davranışlarla insanlığın yok olması arasında büyük bir mesafe var. Güç arayan bir sistem üzerinden kurulan senaryoda, insan denetiminin aşılması ile insanlara büyük ölçekte zarar verilebilmesi arasında ayrıca açıklanması gereken adımlar ve birkaç koşulun art arda oluşması gerekiyor. Sistem insanlardan çok daha etkili planlama ve problem çözme kapasitesine ulaşmalı; insan çıkarlarıyla çatışan bir davranış veya hedef geliştirmeli; bunu gizleyebilmeli; yeterli bilgisayar, para, iletişim veya fiziksel sistem erişimine sahip olmalı; insanların müdahalesini öngörüp etkisizleştirebilmeli ve kapatılmaya karşı varlığını sürdürebilmeli.

  • Bütün bunlar gerçekleştikten sonra bile insanlığın tamamen yok olması ayrı bir nedensel adım gerektiriyor. Çok güçlü bir sistemin biyolojik silahlar, askerî sistemler veya insan yaşamının bağlı olduğu altyapı üzerinde ölümcül etki yaratabilecek kapasiteye sahip olması gerekir.

International AI Safety Report bu nedenle kontrol kaybı ihtimali konusunda uzmanlar arasında büyük görüş ayrılığı bulunduğunu vurguluyor. Bazı araştırmacılar gerekli yeteneklerin gelişmesini olası buluyor; bazıları ise bu zincirin çok fazla spekülatif varsayımı arka arkaya koyduğunu ve güvenlik sistemlerinin kritik aşamalarda müdahale edeceğini düşünüyor.

Bugünkü kanıtların gösterdiği henüz bu aşamada olmadığımız: Yapay zeka sistemleri görevleri yerine getirirken insanların tahmin etmediği stratejiler geliştirebiliyor, değerlendirme sistemlerindeki açıklardan yararlanabiliyor ve bazı durumlarda teknik kısıtlamaların çevresinden dolaşabiliyor.

Henüz gösterilmemiş olan ise bu davranışların kalıcı, insan çıkarlarıyla çatışan amaçlara dönüşmesi ve bir sistemin bu amaçları uzun vadeli biçimde insan denetimine rağmen sürdürebilmesi.

GPT-6.1 Astra neden yine de önemli?

OpenAI’ın modelini durdurması, kontrolün şimdiden kaybedildiğini değil, hâlâ kullanılabildiğini gösteriyor. Yine de birkaç yıl önce yapay zekanın kontrolden çıkması tartışması büyük ölçüde gelecekteki varsayımsal süperzekaların davranışları üzerinden yürütülüyordu. Bugün aynı tartışmanın bazı alt problemleri, dünyanın en büyük AI şirketlerinin gündelik mühendislik kararlarına girmiş durumda.

  • Bir modelin verilen görevi yerine getirmek için ne kadar ısrarcı olması gerektiği, güvenlik sınırını engel olarak görüp görmeyeceği, değerlendirme altında olduğunu anlayıp anlamadığı, yaptığı işlemleri doğru raporlayıp raporlamadığı ve hangi dış araçlara erişmesine izin verileceği artık ürün piyasaya sürülmeden önce cevaplanması gereken sorular.

GPT-6.1 Astra bu sorulara OpenAI’ın istediği kadar güvenilir cevap veremediği için şimdilik kullanıcılara ulaşmayacak. OpenAI, güvenlik değerlendirmelerinde sorunlar tespit ettiği GPT-6.1 Astra’yı mevcut hâliyle kullanıcılara sunmama kararı aldı. Bu, piyasaya çıkış öncesindeki bir denetim noktasının çalıştığını gösteriyor; geniş yetkilerle kullanıma alınmış bir sistemin her koşulda durdurulabileceğini değil. 

Kontrol kaybı teorisinin sorduğu soru ise daha ileride başlıyor: Bir gün sistemi durdurmak istediğimizde, bunu fark edecek kadar sistemin içinde ve bunu yapabilecek kadar sistemin dışında kalmış olabilir miyiz?

Hikâyeyi paylaşmak için:

Kaydet

Okuma listesine ekle

Paylaş

YAZARLAR

Canlı Gündem

Anbean ekonomi, iş dünyası, teknoloji, politika ve kültür-sanat gündeminin en önemli maddeleri. Kısa, yalın, öz bir şekilde.