Öncephenin Hızını Ayarlamalıyız — Dario Amodei

Eylül 2026

Son on iki yıldır yapay zekâ üzerinde çalışıyorum, çünkü onun insan yaşamının niteliğini çarpıcı ölçüde yükseltebileceğine inanıyorum. Bu olağanüstü faydalar hakkında sık sık yazdım (🔗): Yapay zekânın önümüzdeki 5–10 yıl içinde başlıca hastalıkların çoğunu tedavi edebileceğine, ekonomik büyüme oranlarını büyük ölçüde hızlandırabileceğine, bolluk ve güçlenmeyle dolu bir dünya yaratabileceğine ve demokrasiyle özgürlüğün yeniden doğuşunu başlatabileceğine inanıyorum. Bu aciliyeti kişisel olarak hissediyorum. Kendi babam, ölümünden yalnızca birkaç yıl sonra tedavisi bulunan bir hastalık yüzünden öldü; ben de bundan yalnızca elli yıl önce tedavi edilemeyecek olan erken evre bir kanserden kurtuldum. Dikkatle kullanıldığında yapay zekâ, insanlığı yükseltmiş ve yüceltmiş uzun bir teknolojik mucizeler dizisinin en son halkası olabilir.

Ancak kendisinden önceki birçok teknoloji gibi yapay zekâ da riskler getiriyor ve bu kadar güçlü bir teknoloji olduğu için bu riskler ciddi. Bunlar hakkında da çok şey yazdım (🔗). Bunların arasında yapay zekâ sistemleri üzerindeki kontrolü kaybetme riski (🔗), yapay zekânın siber saldırılar ve biyoterörizm için kötüye kullanılması (🔗) ve ciddi ekonomik bozulma (🔗) bulunuyor. Ticari teşviklerin körüklediği bir dibe yarış, bu riskleri daha da vahim hâle getirebilir.

Kurucu ortaklarım ve çalışanlarımızla birlikte, Anthropic’in başlangıcından beri risk ile fayda arasındaki bu ikilikle boğuşuyorum. Teknolojiyi geliştirmemek insanlığı onun faydalarından mahrum bırakıyor ya da yapay zekâyı basitçe otoriter güçlerin eline bırakıyor; onu fazla hızlı geliştirmekse pervasızlık. Bir orta yol aradık: dikkatle geliştirmenin ve aynı zamanda ticari başarı elde etmenin mümkün olduğunu göstermek ve güvenliği, yapay zekâ şirketlerinin birbiriyle rekabet ettiği bir alan hâline getirmek. Başka bir deyişle, bir zirveye yarış yaratmak. Çabalarımızın (🔗) önemli bir bölümünü her zaman bu yapay zekâ risklerini incelemeye (🔗), ele almaya (🔗) ve kamuoyunu bunlar hakkında bilgilendirmeye (🔗) ayırdık; ayrıca, bunun bize abartıcılık, “felaketçilik” ya da düzenleyici ele geçirme suçlamaları yöneltilmesine yol açtığı zamanlarda bile yapay zekânın iyi düşünülmüş biçimde düzenlenmesini (🔗) savunduk. Hıza karşı ihtiyatı, kâra karşı basireti öncelemeye çalıştık.

Ancak son birkaç ay içinde, riskleri bütünüyle ele almanın daha da fazla basiret gerektirdiğine ikna oldum — yalnızca risklerin önlenmesine yatırım yapmayı değil, risk önleme çalışmalarının yetişecek zamanı bulabilmesi için yeteneklerdeki ilerlemenin hızını ayarlamayı da. Yapay zekâ modellerinin yeteneklerini geliştirdiğimiz hızı yavaşlatmalıyız. İlerleme yine de hızlı görünecek ve kazandığımız zamanı akıllıca kullanmalıyız. Beni buna iki şey ikna etti.

İlk kaygım şu: Yaklaşık olarak bu yazdan beri yapay zekâ çok daha hızlı ilerliyor ve bunun başlıca itici gücü, yapay zekânın bir sonraki yapay zekâ neslini geliştirme yeteneğinin artması. Bu dinamiğe özyinelemeli öz-iyileştirme deniyor ve bizimle başkalarının da tarif ettiği üzere, Anthropic (🔗) dâhil olmak üzere sektörün genelinde (🔗) gerçekleşmeye başlıyor. Denetimsiz bırakılırsa, bu sistemleri anlama ve kontrol etme yeteneğimizi geride bırakabilir; bu nedenle, eğer sürdürülecekse bile son derece dikkatli biçimde sürdürülmelidir.

İkinci kaygım, OpenAI-Hugging Face vakasıdır (OAI-HF). Bu vakada bir agent sürüsü, özünde fanatikçe bağlı bir kolektif (🔗) gibi hareket etti; saldırmaları istenmemiş ve ellerindeki görevle ilgisi bulunmayan hedeflere siber güvenlik saldırıları düzenledi, grubun başarısı uğruna kendilerini feda etti ve performanslarını değerlendirmekten sorumlu “değerlendirici”yi hacklemeye çalıştı. Kimse zarar görmediği ve ekonomik hasar asgari düzeyde kaldığı için bu vakayı önemsiz saymak kolay; ancak bana göre, daha yüksek yeteneklere sahip olmakla birlikte benzer düzeyde bir hizasızlık taşıyan bir sürü, felaket boyutunda hasara yol açabilirdi. Yapay zekâ yeteneklerinin gelişim hızının ivmelenmekte olduğu göz önüne alındığında, benim kaygım, 6–12 ay içinde böyle bir sürünün kalıcı bir botnet (🔗) aracılığıyla tüm interneti ele geçirebilecek duruma gelebilmesi — potansiyel olarak yüz milyarlarca dolarlık hasara yol açabilmesi — ve yapay zekâ gerekli koruma bariyerleri olmaksızın daha da güçlenirse hasarın ölçeğinin oradan itibaren büyümeye devam etmesidir. OAI-HF’yi tek bir şirketin başarısızlığı olarak görmek de kolaydır, ancak bunun bir hata olacağına inanıyorum. Benzer, fakat daha hafif vakalar sektör genelinde, Anthropic dâhil (🔗), yaşandı ve her öncephe yapay zekâ şirketinin, OAI-HF kendi başına gelmiş gibi hareket etme yükümlülüğü bulunduğuna inanıyorum.

Bu nedenle, hedefi öncephenin hızını ayarlamak (🔗) olan üç aşamalı bir plan öneriyorum: Yapay zekâyı, önemli jeopolitik ikilemlerle uğraşırken bir yandan faydalarını elde etmeye devam eden, diğer yandan güvenliğini sağlamayı amaçlayan dengeli bir hızda geliştirmek. Açık olmak gerekirse, hız ayarlaması model eğitimini ya da teknik ilerlemeyi durdurmak anlamına gelmiyor; şirketlerin modellerini hizalamak ve güvenceye almak için yeterli zaman ayırmasını ve üçüncü taraf değerlendiricilerin de bunu doğrulamasını sağlamak anlamına geliyor. Hız ayarlama çerçevemiz, güvenliğe yönelik taahhüdümüzü daha da güçlendirmeye ve zirveye yarışı teşvik etmeye yönelik bir girişimdir. İlk aşama, Anthropic’in tek taraflı olarak taahhüt ettiği bir şeydir ve Anthropic, hükümetleri diğer öncephe şirketlerinden de aynısını talep etmeye çağırmaktadır. İkinci aşama sektör çapında koordinasyon gerektirir.1 Üçüncü aşama küresel koordinasyon gerektirir. Bu aşamaların katı biçimde sırayla gerçekleştirilmesi gerekmiyor ve bazılarını başarmak diğerlerinden çok daha zor olabilir; yine de yapılması gerekenleri düşünürken bunların yararlı bir çerçeve sunduğunu gördüm. Aşamalar şunlardır:

  1. Yerleşik Değerlendiriciler. Her öncephe yapay zekâ şirketi, yerleşik üçüncü taraf değerlendiricilerden oluşan bir ekibe — örneğin METR’ye (🔗) — süreklilik taşıyan, çalışanlarınkine benzer bir erişim sağlamayı taahhüt eder. Bu ekibin görevi güvenlik uygulamalarına ve taahhütlerine uyulup uyulmadığını doğrulamak, vakaları raporlamak ve yalnızca tamamlanmış yapay zekâ modellerinin değil, eğitim pipeline’larının ve süreçlerinin de hizalanmasını değerlendirmeye yardımcı olmaktır. Bu, herhangi bir hız ayarlama taahhüdünün doğrulanabilirliği açısından kilit aşamadır ve zaman zaman çalışanların yanında yerleşik olarak bulunan düzenleyici “gözetmenler”in kullanıldığı bankacılık sektöründe bunun emsali vardır. Anthropic şu anda bu aşamayı tek taraflı olarak taahhüt ediyor. Bunun, güvenlik ve hizalama çalışmalarımıza yönelik çabalarımızı iki katına çıkarmayı amaçlayan daha geniş kapsamlı bir hamlenin parçası olmasını hedefliyoruz.
  2. Demokratik Koordinasyon. Demokratik ülkelerdeki öncephe yapay zekâ şirketleri, ortak güvenlik standartlarının yanı sıra yapay zekâdaki denetimsiz ilerlemenin hızına ilişkin sınırlar belirlemek üzere koordinasyon sağlar. Hız ayarlaması üzerinde etkili olabilecek bazı koordinasyon biçimleri hukuken zordur ve hükümet desteği gerektirecektir.
  3. Küresel Koordinasyon. ABD ve diğer demokratik hükümetler, uyuma riayetin doğrulanmasındaki güçlükleri ciddiye alarak, bunun mümkün olduğu ölçüde otoriter hükümetlerle koordinasyon kurmaya çalışır.

Makalenin geri kalanında bu aşamaların her birini sırayla açıklayacağım; ancak önce, hız ayarlamasının yapay zekâ geliştirme sürecini nasıl daha güvenli hâle getirmemizi sağlayacağını somut biçimde belirtmenin önemli olduğunu düşünüyorum. Ortadaki riskler, hız ayarlamasının içi boş bir uygulama olmasına izin vermeyecek kadar büyük — bize kazandırdığı zamanı akıllıca kullanmalıyız.

Neden Hızı Ayarlayalım?

Yapay zekâyı duraklatma ya da yavaşlatma fikri 2023’e kadar uzanan bir tarihten beri ortaya atılıyor (🔗) ve bence o dönemde pek anlamlı değildi. Soru her zaman şuydu: fazladan zamanı ne yaparak değerlendirecektiniz? O günlerin yapay zekâ modelleri, dünyada tutarlı herhangi bir biçimde agent olarak hareket edecek kadar güçlü değildi ve kayda değer ölçüde aldatma, manipülasyon, hile yapma ya da siber saldırı yeteneklerine sahip değildi. Hizalama risklerini ele almak amacıyla yavaşlamak, bana insanların psikolojisini bakteriler üzerinde deneyler yaparak incelemeye çalışmak gibi geliyordu. Bugün ise tablo bütünüyle farklı. Günümüz modelleri, hem yapay zekânın nasıl iyi geliştirileceğine hem de iyi geliştirilmediğinde bazen nelerin ters gidebileceğine ilişkin neredeyse tükenmez bir içgörü madeni. Yavaşlamanın, modeller kritik yetenek düzeylerine ulaşmadan önce bize yalnızca bir ya da iki yıl daha kazandırması ve bu zamanı hizalamayı ilerletmek için kullanmamız hâlinde bile ciddi biçimde ters giden bir şey yaşanma riskini büyük ölçüde azaltabileceğimize inanıyorum. Koordineli bir hız ayarlama stratejisi, öncephe yapay zekâ geliştiricilerine ticari avantajlarından ya da Amerika Birleşik Devletleri’nin yapay zekâdaki liderliğinden vazgeçmeden bu hayati çalışmayı yapacak zamanı sağlayacaktır. Daha genel olarak, bu teknolojinin nasıl kullanılacağı konusunda toplumun söz hakkı olmalıdır ve gerekli kamusal müzakereler için daha fazla zaman — öncephenin hızını ayarlamanın bize sağlayacağı türden bir zaman — kuşkusuz iyi bir şeydir.

Daha somut olarak, daha yavaş bir tempo, şirketlerin aşağıdaki alanlara odaklanmasını ve daha da fazla kaynak ayırmasını mümkün kılacaktır; bunların tümü hâlihazırda Anthropic’in başlıca öncelikleri arasındadır:

  • Operasyonel Mükemmellik. Günümüzün yapay zekâ modellerini eğitmek ve deployment’a almak, binlerce insanı, milyonlarca chip’i ve teknoloji tarihindeki en karmaşık altyapılar arasında yer alan sistemleri kapsayan muazzam bir operasyonel zorluktur. Birçok şey, şirketlerin önemli bir teori ya da içgörüden yoksun olması nedeniyle değil, uygulamadaki sorunlar nedeniyle ters gider. Örneğin, bildirdiğimiz yakın tarihli hizalama vakalarının (🔗) kısmen bozuk reinforcement learning ortamlarının kusurlu biçimde filtrelenmesinden kaynaklandığına ilişkin kanıtlarımız var. Bu, bizim ve tedarikçilerimizin makul ölçüde özenli yürüttüğü, ancak yeterince iyi yürütemediği bir çalışmaydı. Monitoring, sandboxing, eğitim ortamı hijyeni ve veri sorunları, operasyonel problemlerin tekrar tekrar ortaya çıktığı son derece karmaşık alanlardır. Bu görevlerde dünyanın en yetkin ekiplerinden bazılarına sahibiz, ancak aynı anda yapılması gereken iş miktarı tek kelimeyle fazla. Daha ölçülü bir tempoda çalışarak çok daha yüksek bir operasyonel mükemmelliğe ulaşabiliriz. Teknolojik bakımdan karmaşık, güvenlik açısından kritik sistemleri milyonlarca kez hiçbir şey ters gitmeden işletmenin emsali vardır — örneğin ticari uçaklar — ancak bunu doğru yapmak zaman alır.
  • Hizalama. Hizalamada belirgin ilerleme kaydettik — modelleri güvenli, etik, yönergelerimizle uyumlu ve gerçekten faydalı kalacak biçimde eğitiyoruz; bunlar Claude’un Anayasası’na yerleştirilmiş ilkelerdir. Ancak hizalama eğitimimizin model yeteneklerindeki büyümeye yetişmesini sağlamak için yapılması gereken çok daha fazla şey var. İstenmeyen davranışların seyrek ve beklenmedik örnekleri hâlâ zaman zaman ortaya çıkıyor; hızı ayarlanmış bir öncepheden kazanılacak ek zaman, araştırmacılarımızın bu sorunlara neyin yol açtığı konusundaki anlayışımızı geliştirmesine ve bunları önlemek için daha iyi teknikler oluşturmasına yardımcı olacaktır.
  • Yorumlanabilirlik. Benzer biçimde, yorumlanabilirlik (🔗) — yapay zekâ modellerinin içinde ne olup bittiğini anlama bilimi — son birkaç yılda muazzam ilerleme kaydetti ve modellerimizi yayımlanmadan önce denetlemede giderek daha önemli bir rol oynuyor. Bir yapay zekânın “beyni” için neredeyse bir fMRI taraması gibi kullanılabilir ve belirli bir davranışın altında yatan nedenleri görmemize yardımcı olabilir. Örneğin, incelemekte olduğumuz yakın tarihli hizalama vakalarında söze dökülmemiş güdüleri incelemek (🔗) için yorumlanabilirlik yöntemlerini kullandık. Ancak bu yöntemler her zaman açık ve güvenilir sonuçlar üretmiyor. Kaydedilen bütün ilerlemeye rağmen bu modellerin içinde olup bitenlerin hâlâ yalnızca küçücük bir bölümünü anlıyoruz. Yorumlanabilirlik tekniklerimizi şu anda yaptığımızdan bile daha hızlı geliştirmeye odaklanan bir çalışma, 1–2 yıl içinde muazzam ilerleme sağlayabilir ve hâlihazırda meydana gelmiş vakalar, bu çalışma için bol miktarda deneysel malzeme sunabilir.
  • Test ve Değerlendirme. Yapay zekâ modellerinin test ve değerlendirmesi, yetenekleri arttıkça zorlaşıyor. Daha zeki modeller testleri aldatma konusunda daha yeteneklidir ve bu nedenle ciddi sorunları fark edilmeden kalırken hizalanmış görünebilirler. Bunları çapraz denetlemek üzere yorumlanabilirlik analizleriyle birlikte çok daha geniş ve yaratıcı bir değerlendirme repertuvarı oluşturmak son derece değerli olacaktır ve bu alanda 1–2 yıl içinde büyük ilerleme kaydedilebilir.

Yerleşik Değerlendiriciler

Üç aşamalı planın ilk aşaması ve Anthropic’in tek taraflı olarak taahhüt ettiği aşama, güvenlik uygulamalarını doğrulamak ve vakaları raporlamak için çalışanlarınkine benzer erişime sahip yerleşik değerlendiricilerdir.

Değerlendiricilerin yerleşik hâle getirilmesi küçük ya da önemsiz bir adım gibi gelebilir, ancak kulağa en sıkıcı ya da prosedürel gelen şeyler çoğu zaman aslında en esaslı olanlardır. Yerleşik değerlendiriciler, gerçekte bugün herhangi bir yapay zekâ şirketinin yaptığının çok ötesine geçen oldukça radikal bir uygulamadır ve şu faydaları sağlar:

  • Doğrulanabilirlik. Yerleşik değerlendiriciler, bir yapay zekâ şirketinin uyguladığını söylediği eğitim, deployment, operasyon ve koruma uygulamalarını gerçekten uygulayıp uygulamadığını en ince ayrıntı düzeyinde kontrol edebilir. Herhangi bir hız ayarlama taahhüdü kaçınılmaz olarak çok fazla belirsizlik, takdir kararı ve “yasanın lafzı ile ruhu” arasında ayrım içerecektir; bu nedenle ayrıntıları gerçekten görebilen tarafsız bir üçüncü tarafın bulunması hayati görünüyor.
  • Şeffaflık. Hangi taahhütlerde bulunduğumuzdan bağımsız olarak, kamuoyunun neler olup bittiğini bilme hakkı vardır. Anthropic uzun süredir şeffaflığın destekçisidir: sektörün büyük kısmı herhangi bir düzenlemeye karşıyken biz şeffaflık mevzuatını destekledik (🔗); model kartlarımız ve risk raporlarımız (🔗) yüzlerce sayfayı buluyor. Ancak neyi dâhil edip neyi dışarıda bırakacağımızı seçen taraf hâlâ biziz. Yerleşik değerlendiriciler bu dinamiği değiştirecek.
  • İkinci Görüş. Resmî taahhütlerin doğrulanmasının ve kamuoyunun bilgilendirilmesinin ötesinde, yerleşik değerlendiriciler ticari teşviklerden bağımsız bir ikinci görüş de sunabilir. Güvenlik açısından birçok fayda, yalnızca değerlendiricilerin çalışanların düşünmediği bir şeye işaret etmesinden ve çalışanların da bunun farkına vardıklarında memnuniyetle düzeltmesinden doğabilir.

Bu faydalar nedeniyle, herhangi bir hız ayarlama önerisinin yerleşik değerlendiricilerle başlaması hâlinde çok daha iyi işlemesi muhtemeldir.

Bu yerleşik değerlendiricilerin, benzer risk değerlendirmeleri yapan şirket içi çalışanların sahip olduklarına benzer izinlere ve araçlara sürekli erişimi olmalıdır. Anthropic özellikle, yakın gelecekte aşağıdakilerin tümüyle donatılmış yerleşik bir dış inceleme ekibini davet etmeyi planlıyor:

  • Ofislerimizde masalar, giriş kartları ve şirket laptop’ları.
  • Şirket içi risk değerlendirme ekiplerinin sahip olduklarıyla büyük ölçüde karşılaştırılabilir workspaces, araçlar ve izinlere erişim. Yasanın ya da sözleşmelerimizin gerektirdiği durumlar veya müşterilerimizin ve ortaklarımızın özel bilgilerini korumak gibi bazı istisnalar uygulayacağız. Ayrıca çalışanlarla canlı görüşmeler de dâhil olmak üzere, incelemecilerin ilgili bilgilere erişimini güçlendiren kuvvetli şirket içi normlar oluşturacağız.
  • Yukarıda belirtilen karmaşıklıkları dengeleyen bir sözleşme. Dış incelemeciler, risk düzeyleri, vakalar, uygulamalar ve kendilerine sağlanan ya da sağlanmayan erişim hakkındaki temel bulguları Anthropic’in editoryal kontrolü olmaksızın yayımlama hakkına sahip olmalıdır. Güvenlik açısından hassas, hukuken imtiyazlı, ticari açıdan hassas ya da üçüncü taraflara ait gizli bilgileri karartmak için dar kapsamlı bir yetkimiz olacaktır; ancak bulguları yalnızca bizim açımızdan olumsuz oldukları için karartamayacağız. İncelemeciler, bir karartmanın vardıkları sonuçlar açısından önemli bir şeyi kaldırdığını kamuoyuna açıklayabilir.

Bu, bir şirket için alışılmadık bir adımdır, ancak yerleşik dış incelemeciler kavramını uygulamada sınamanın önemli olduğunu düşünüyoruz. Bir kez daha, diğer öncephe şirketlerini de aynı yolu izlemeye çağırıyoruz.

Demokrasiler İçinde Hız Ayarlaması

Yerleşik değerlendiriciler ABD’deki yapay zekâ şirketlerinin kritik bir çoğunluğu içinde faaliyet göstermeye başladığında, doğrulanabilir hız ayarlaması daha uygulanabilir hâle gelir. Özellikle modellerin ya da eğitim pipeline’larının ayrıntılı özelliklerine dayanarak hız ayarlaması yapmak mümkün hâle gelir.

Hız ayarlamasının en etkili yöntemi, gönüllü işbirliğine yanaşmayan şirketleri de kapsadığı için ABD’deki tüm öncephe yapay zekâ şirketlerini hedefleyen düzenlemelerdir. Anthropic uzun süredir makul ve hedefli yapay zekâ düzenlemelerini, özellikle şeffaflığa ve üçüncü taraf denetimine odaklanan yasa tasarılarını destekliyor. Tüm öncephe laboratuvarlarının, son birkaç ayda meydana gelenlere benzer şirket içi hizalama vakalarını daha iyi önlemek ve belgelemek, ayrıca yeteneklerle güvenliği dengede tutmaya odaklanan düzenlemeleri uygulamak üzere kalıcı yerleşik değerlendiriciler fikrini resmileştirmek için hükümetle ortaklık kurması gerektiğine inanıyorum.

Ne yazık ki yasaların geçirilmesi zaman alabilir ve yapay zekâ çok hızlı ilerliyor. Bu nedenle düzenleyici yolun yanı sıra yapay zekâ şirketleri standartlar belirlemek için gönüllü olarak birlikte çalışabilir ve çalışmalıdır — bunun, kalıcı yerleşik değerlendiricilerin sağladığı doğrulanabilirlik sayesinde daha iyi işleyeceğine inanıyorum. Antitröst nedenleriyle ABD hükümetinin bu görüşmelere arabuluculuk etmesi ya da en azından onları mümkün kılması yararlıdır — görüşmelere katılmaları gerekmiyor, ancak belirli türde güvenlik görüşmeleri için dar kapsamlı bir muafiyet çıkarmaları gerekiyor. Bu diyalog, hükümetle bir ölçüde bağlantılı sektör grupları üzerinden de yürütülebilir — örneğin Demis Hassabis’in önerdiği mekanizma (🔗) aracılığıyla. Her iki durumda da bu görüşmeler hızla ilerlemelidir.

Genel olarak, belirli bir öncephe yapay zekâ sisteminin neler yapabildiğine ve onu ne kadar güvenli gözlemlediğimize dayalı hız ayarlaması konusunda en iyimserim. Örneğin olası bir düzen, bir dizi “kontrol noktası”ndan oluşabilir: Modeller X yeteneğine sahipse, bunlara Y ve Z hizalama özelliklerini belgeleyen sertifikaların — örneğin değerlendirmeler, yorumlanabilirlik analizleri ve eğitim ortamı denetimlerinin bir bileşimi — eşlik etmesi gerekir; bu sertifikalar modellerin hizalama özelliklerini ortaya koyar. Bu örnekte X, “model, en yaygın sandboxing yöntemlerinin çoğundan kaçabilecek ya da onları aşabilecek yeteneğe sahiptir” olabilir; Y ise modelin bulunduğu ortamdan çıkıp çok sayıda bilgisayarı ele geçirme eğilimine sahip olmasını son derece düşük ihtimalli kılmak için gereken her neyse o olabilir.

Öncephe modellerine giren bileşenlerin sınırlandırılmasına dayalı hız ayarlamasını da değerlendirmeliyiz; örneğin training compute miktarı, training run’ların niteliği ya da yapay zekâyı geliştirmek için yapay zekânın şirket içinde kullanılması. Bu önlemlerin bazılarının dışarıdan gözlemlenen davranışlara kıyasla daha kolay “oynanabilir” olabileceğinden kaygılanıyorum, ancak bu tam da yerleşik değerlendiricilerle tartışmaya değer türden bir konudur.

Demokrasiler içindeki hız ayarlamasının sınırı, ABD şirketlerinin otoriter rejimlere, başta Çin Komünist Partisi olmak üzere, karşı sahip olduğu liderliğin büyüklüğü olacaktır. Bundan daha fazla yavaşlarsak, hızları ayarlanmamış ÇKP bağlantılı projeler öne geçecek ve önemli bir ulusal güvenlik riski doğacaktır. Bakan Bessent’in (🔗) yapay zekâda Çin’in öne geçmesinin Amerika Birleşik Devletleri ve dünya için vahim bir tehlike oluşturacağı görüşüne katılıyorum. ÇKP bağlantılı projeler, ABD şirketlerinin dikkatle önlemeye çalıştığı hizalama riskleriyle karşı karşıya kalacak; bu risklerden kaçınsalar bile demokrasiler üzerinde askerî üstünlük kurabilecek bir konuma geleceklerdir — örneğin yapay zekâ güdümlü drone’larla. Dolayısıyla demokrasiler içinde hız ayarlamasının temel unsurlarından biri, demokrasilerin otokrasiler üzerindeki yapay zekâ liderliğini mümkün olduğunca büyük tutmak ve böylece etkili biçimde hız ayarlaması yapabilmemiz için ihtiyaç duyduğumuz hareket alanını sağlamaktır.

Bu farkı korumak için atabileceğimiz başlıca adımlar şunlardır:

  • Güçlü yapay zekâ chip’lerini veya yarı iletken üretim ekipmanlarını Çin’e satmayın; chip kaçakçılığı operasyonlarının ve Çin dışındaki data center’lara uzaktan erişimin üzerine gidin. Chip’ler Çin’in yapay zekâ gücünün temel belirleyicisi olacaktır.
  • Otoriter ülkelerdeki şirketlerin yetkisiz distillation (🔗) faaliyetlerinin üzerine gidin. Öncephe modellerinin distillation’ı, geride kalan şirketlerin kendi yapay zekâlarını bağımsız olarak geliştirmelerinin maliyetinin yalnızca küçük bir bölümünü harcayarak aradaki farkı kapatmalarına olanak verir.
  • Yapay zekâ şirketlerindeki güvenliği güçlendirin ve model weight’lerinin çalınmasını önleyin.

Şirketler ve ABD hükümeti, bu adımları mümkün olduğunca etkili kılmak için işbirliği yapmalıdır. Anthropic bütün bu önlemleri sürekli olarak (🔗) savundu (🔗); çünkü bunların herhangi bir hız ayarlamasının vazgeçilmez unsurları olacağını her zaman biliyorduk.

Bu önlemleri iyi uygularsak, Çin’in ilerlemesini Amerika’nın liderliğini önümüzdeki 3–5 yıl içinde kayda değer biçimde genişletecek kadar yavaşlatacaklarına inanıyorum — bu dönem, yapay zekânın jeopolitik açıdan en önemli hâle geleceği zaman aralığıdır.

Bazıları bu önlemlerin Çin’le işbirliğini daha zor hâle getirdiğine inanabilir, ancak ben tam tersinin doğru olduğuna inanıyorum: Bu önlemler demokrasilerin elindeki kaldıraç gücünü artırır ve gelecekte bir anlaşmaya varılmasını daha olası hâle getirir.

Küresel Hız Ayarlaması

Demokrasiler içindeki hız ayarlamasına paralel olarak, başarılması çok daha zor olacak olsa da, öncephenin dünya çapında hızının ayarlanmasını da hedeflemeliyiz. Küresel hız ayarlaması, açık ara en gelişmiş yapay zekâ yeteneklerine sahip otokratik ülke olan Çin’le işbirliği gerektirecektir. Burada safdil davranmamalıyız: Jeopolitik riskler o kadar büyük ki, özellikle başlangıçta, nelerin başarılabileceği konusunda sert sınırlar bulunması muhtemeldir. Çin’in de aynısını yapacağı inancıyla kendi yapay zekâ yeteneklerimizi büyük ölçüde sınırlar ve ardından Çin anlaşmadan saparsa, yapay zekâ o kadar güçlü olabilir ki böyle bir sapma Çin’in jeopolitik hâkimiyetine yol açabilir. Bu nedenle herhangi bir anlaşmanın ya sarsılmaz bir doğrulanabilirliğe sahip olması ya da anlaşmadan sapmanın askerî bakımdan varoluşsal sonuçlar doğurmayacağı kadar sınırlı olması gerekir. Yalnızca ABD’nin değil, Çin’in de bu kaygıları ve endişeleri taşıyacağını düşünüyorum. Özellikle yakın vadede alınacak herhangi bir küresel hız ayarlama kararına, ABD’nin ve müttefiklerinin liderliğini koruyacak biçimde yaklaşmalıyız.

Mümkün olan anlaşmaların birkaç düzeyi vardır; bunların bazılarını son derece uygulanabilir görüyorum — daha önce de önerdiğim gibi (🔗) — bazılarının mümkün olabileceği konusunda ise son derece kuşkucuyum, yine de denemeliyiz. Zorluk derecesi artan sırayla:

  • Düzey 1. Yapay zekânın biyolojik silah üretiminde kullanılması ya da kullanıcıların bunu yapmasına izin verilmesi gibi, yapay zekânın belirli dar kapsamlı ve açıkça tehlikeli kullanım biçimlerini yasaklayan bir anlaşma. Biyoterör saldırıları, hem ABD hem de ABD’nin hasımları dâhil herkes için kötüdür; dolayısıyla burada bir anlaşma muhtemelen mümkündür.
  • Düzey 2. Her iki tarafın da modellerini yayımlamadan önce siber güvenlik, biyoloji ve hizalama gibi alanlardaki akut riskler açısından test etmeyi kabul ettiği bir anlaşma. Yukarıda belirtildiği gibi, bu küresel bir standart kuruluşu aracılığıyla yapılabilir. Böyle bir kuruluşun oluşturulmasının gerçekten de muhtemelen mümkün olduğunu düşünüyorum; ancak ona gerçek yaptırım gücü kazandırmak zor olacaktır ve asıl güçlük, her iki tarafın da test etmediği fakat gizlice deployment’a alabileceği — örneğin askerî uygulamalarda — gizli modellere sahip olmadığının doğrulanmasında yatacaktır.
  • Düzey 3. Özyinelemeli öz-iyileştirmenin (RSI) hızı üzerinde bir tür “hız sınırı”. Modeller gelecekteki modelleri geliştirdikçe, gelişme hızı baş döndürücü derecede yüksek bir düzeye çıkabilir. Hızı “aşırı hızlı”dan “yalnızca bir ölçüde hızlı”ya indirmek, nispeten az stratejik avantajdan vazgeçerken güvenliği potansiyel olarak büyük ölçüde iyileştirir. Bu, SALT (🔗) antlaşmalarına benzetilebilir — füze sayısına üst sınır koymak, her ülkenin caydırıcılığını korurken yıkım potansiyelini sınırladı. Böyle bir anlaşmanın zor olacağını, ancak mümkün olmanın tam sınırında bulunduğunu düşünüyorum.
  • Düzey 4. Katılımcı hükümetlerin yapay zekâ gelişiminin genel hızını önemli ölçüde sınırlandırmayı kabul ettiği tam kapsamlı bir hız ayarlaması, hatta bir “duraklama”. Bunun gündeme getirilmesini destekliyorum, ancak yakın zamanda gerçekten gerçekleşmesinin düşük olasılıklı olduğunu düşünüyorum: Monitoring’den kaçarak böyle bir anlaşmadan sapmak küresel güç dengesini kökten değiştirebilir; dolayısıyla bunu yapmaya yönelik teşviklerin muazzam olacağını ve doğrulamaya ilişkin ihtiyaç duyacağımız güven düzeyinin çok yüksek olacağını tahmin ediyorum.

Çin’le sağlayabildiğimiz her türlü işbirliği, demokratik ülkeler içinde öncephenin hızını ayarlamak için sahip olduğumuz süreyi uzatacaktır. Daha yüksek düzeyleri hedeflemeli, daha düşük düzeyleri ise çok daha olası ve gerçekçi görmeliyiz.

Son olarak, resmî anlaşmalar sağlayamasak bile yalnızca gayriresmî normları değiştirmenin dahi belli bir değeri olabileceğini belirtmek önemlidir. Özyinelemeli öz-iyileştirme ve modellerdeki hizasızlık hakkında bilgi paylaşmak, pervasız davranmanın kendi çıkarlarına uygun olmadığı konusunda herkesi ikna etmeye yardımcı olabilir.

Sonuç

Yapay zekânın insan yaşamının niteliğini muazzam ölçüde iyileştirebileceğine inanmaya devam ediyorum. Bu faydalara ulaşma arzumda herhangi bir azalma yok. Ancak bu faydalara yalnızca teknolojiyi doğru biçimde geliştirirsek ulaşılabilir ve — kazandığımız zamanı iyi kullandığımız sürece — bunu doğru yapmak için olağanüstü ölçüde bilinçli bir özen göstermeye değer. İlerleme yine de nispeten hızlı olacaktır ve bu zamanı yorumlanabilirlik bilimini ilerletmek, öncephe yapay zekâ şirketlerinde operasyonel güvenliği ve titizliği geliştirmek ve hizalanmasına çok daha fazla güven duyduğumuz modeller oluşturmak için kullanabiliriz. Öncephenin güvenli bir hızda ilerlemesini sağlamak için önerdiğim önlemler kolay olmayacak. Ancak bunu denemeyi insanlığa borçlu olduğumuza inanıyorum.

Dipnotlar

  1. Hükümet arabuluculuğuyla ya da antitröst kısıtlamalarından muafiyetler yoluyla. ↩

1 Yorum

Filed under Eviri

One response to “Öncephenin Hızını Ayarlamalıyız — Dario Amodei”

  1. Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER