DeepSeek ve İhracat Kontrolleri Üzerine — Dario Amodei

🦋🤖 Robo-Spun by IBF 🦋🤖

Ocak 2025

Birkaç hafta önce, ABD’nin Çin’e yönelik çip ihracat kontrollerinin güçlendirilmesi gerektiğine dair bir argüman sundum. O zamandan beri, Çinli bir yapay zeka şirketi olan DeepSeek, en azından bazı açılardan, ABD’nin en ileri düzey yapay zeka modellerinin performansına daha düşük maliyetle yaklaşmayı başardı.

Burada, DeepSeek’in Anthropic gibi ABD’li yapay zeka şirketleri için bir tehdit olup olmadığına odaklanmayacağım (gerçi, ABD’nin yapay zeka liderliğine yönelik tehditlerine dair birçok iddianın büyük ölçüde abartıldığını düşünüyorum)¹. Bunun yerine, DeepSeek’in yayınladığı modellerin çiplere yönelik ihracat kontrol politikalarının gerekçesini zayıflatıp zayıflatmadığına odaklanacağım. Bunun böyle olduğunu düşünmüyorum. Aslında, bu ihracat kontrol politikalarını bir hafta öncesine kıyasla çok daha hayati hale getirdiklerini düşünüyorum².

İhracat kontrolleri çok önemli bir amaca hizmet ediyor: demokratik ülkelerin yapay zeka geliştirme alanında en ön sırada yer almasını sağlamak. Açık olmak gerekirse, bunlar ABD ile Çin arasındaki rekabetten kaçınmanın bir yolu değil. Nihayetinde, ABD ve diğer demokratik ülkelerdeki yapay zeka şirketleri, Çin’dekilerden daha iyi modellere sahip olmalı ki üstün gelebilelim. Ancak, Çin Komünist Partisi’ne zorunda olmadığımız halde teknolojik avantajlar sunmamalıyız.

Yapay Zeka Gelişiminin Üç Dinamiği

Politika argümanımı sunmadan önce, yapay zeka sistemlerinin temel olarak üç dinamiğini açıklayacağım. Bunları anlamak çok kritik:

Ölçekleme yasaları. Yapay zekanın bir özelliği — ki ben ve kurucu ortaklarım OpenAI’de çalışırken bunu belgeleyen ilk kişiler arasındaydık — eşit diğer koşullar altında, yapay zeka sistemlerinin eğitimini ölçeklendirmek, çok çeşitli bilişsel görevlerde istikrarlı bir şekilde daha iyi sonuçlar elde edilmesini sağlar. Örneğin, 1 milyon dolarlık bir model önemli kodlama görevlerinin %20’sini çözebilirken, 10 milyon dolarlık bir model %40’ını, 100 milyon dolarlık bir model %60’ını çözebilir ve bu şekilde devam eder. Bu farklar pratikte büyük sonuçlar doğurur — başka bir 10 kat artış, lisans düzeyi ile doktora düzeyi arasında bir fark yaratabilir — bu yüzden şirketler bu modelleri eğitmeye büyük yatırımlar yapmaktadır.

Eğriyi kaydırma. Alan, büyük veya küçük fark etmeksizin, işleri daha etkili veya verimli hale getiren fikirler üretmeye sürekli devam etmektedir: bu, modelin mimarisinde bir gelişme (tüm günümüz modellerinin kullandığı temel Transformer mimarisinde bir değişiklik) veya modeli temel donanımda daha verimli çalıştırmanın bir yolu olabilir. Yeni nesil donanımlar da aynı etkiye sahiptir. Bu tür yenilikler genellikle eğriyi kaydırır: eğer inovasyon 2 katlık bir “hesaplama çarpanı” (CM) ise, o zaman 10 milyon dolar yerine 5 milyon dolarla kodlama görevinde %40 başarı elde edebilirsiniz; ya da 100 milyon dolar yerine 50 milyon dolarla %60 başarı sağlayabilirsiniz vb. Her ileri düzey yapay zeka şirketi düzenli olarak bu tür CM’ler keşfetmektedir: sıklıkla küçük olanları (~1.2x), bazen orta büyüklükte olanları (~2x) ve zaman zaman çok büyük olanları (~10x). Daha zeki bir sisteme sahip olmanın değeri çok yüksek olduğu için, bu eğri kayması şirketlerin modellere daha az değil, daha fazla harcama yapmasına neden olur: maliyet verimliliğindeki kazanımlar tamamen daha akıllı modellerin eğitilmesine yönlendirilir ve bu yalnızca şirketin finansal kaynakları ile sınırlıdır. İnsanlar doğal olarak “önce bir şey pahalıdır, sonra ucuzlar” fikrine kapılma eğilimindedir — sanki yapay zeka sabit kalitede tek bir şeymiş gibi ve ucuzladığında daha az çip kullanarak eğitebilirmişiz gibi. Oysa önemli olan ölçekleme eğrisidir: eğri kaydığında, onu daha hızlı kat ederiz, çünkü eğrinin sonundaki şeyin değeri çok yüksektir.

2020’de ekibim, algoritmik ilerleme nedeniyle eğrinin kaymasının ~1.68x/yıl olduğunu öne süren bir makale yayımladı. Bu hız muhtemelen önemli ölçüde arttı; ayrıca verimlilik ve donanım faktörlerini de içermiyordu. Bugün bu sayının muhtemelen ~4x/yıl civarında olduğunu tahmin ediyorum. Bir başka tahmin de burada. Eğitim eğrisindeki kaymalar, aynı zamanda çıkarım (inference) eğrisini de kaydırır ve bunun sonucu olarak, model kalitesi sabit tutularak büyük fiyat düşüşleri yıllardır gerçekleşmektedir. Örneğin, Claude 3.5 Sonnet, orijinal GPT-4’ten 15 ay sonra yayımlanmış olup, hemen hemen tüm kıyaslamalarda GPT-4’ü geride bırakırken, API fiyatı yaklaşık ~10 kat daha düşüktür.

Paradigmayı değiştirmek. Ara sıra, ölçeklendirilen temel şey biraz değişir ya da eğitim sürecine yeni bir ölçeklendirme türü eklenir. 2020-2023 yılları arasında ölçeklendirilen temel şey, önceden eğitilmiş modellerdi: büyük miktarda internet metniyle eğitilen ve üzerine çok az ek eğitim eklenen modeller. 2024 yılında, modelleri düşünme zincirleri oluşturacak şekilde eğitmek için pekiştirmeli öğrenme (RL) kullanma fikri ölçeklendirmenin yeni odak noktası haline geldi. Anthropic, DeepSeek ve birçok diğer şirket (muhtemelen en dikkat çekeni, Eylül ayında o1-preview modelini yayımlayan OpenAI) bu tür bir eğitimin, matematik, kodlama yarışmaları ve bunlara benzeyen akıl yürütme görevleri gibi belirli, nesnel olarak ölçülebilir görevlerde performansı büyük ölçüde artırdığını keşfetti.

Bu yeni paradigma, sıradan önceden eğitilmiş modellerle başlamayı ve ardından ikinci bir aşama olarak RL kullanarak akıl yürütme becerilerini eklemeyi içeriyor. Önemli olan şu ki, bu tür RL yeni olduğu için hala ölçeklendirme eğrisinin çok başındayız: ikinci RL aşamasına yapılan harcamalar tüm şirketler için küçük. 0.1 milyon dolar yerine 1 milyon dolar harcamak bile büyük kazanımlar sağlıyor. Şirketler şimdi bu ikinci aşamayı yüz milyonlarca ve milyarlarca dolara ölçeklendirmek için çok hızlı çalışıyor, ancak anlamak çok önemli ki şu anda ölçeklendirme eğrisinin erken bir noktasında olan ve bu nedenle hızla büyük kazançlar sağlayabilecek güçlü yeni bir paradigma ile “geçiş noktasında” bulunuyoruz.

DeepSeek’in Modelleri

Yukarıda açıklanan üç dinamik, DeepSeek’in son model duyurularını anlamamıza yardımcı olabilir. Yaklaşık bir ay önce, DeepSeek “DeepSeek-V3” adlı, yalnızca önceden eğitilmiş bir model³ yayımladı—yani yukarıda #3’te açıklanan ilk aşama. Geçen hafta ise ikinci aşamayı ekleyen “R1” modelini duyurdu. Bu modeller hakkında dışarıdan her şeyi belirlemek mümkün değil, ancak aşağıda bu iki sürüme dair en iyi anlayışımı paylaşıyorum.

DeepSeek-V3 aslında gerçek yenilikti ve insanların bir ay önce farkına varması gereken şeydi (biz kesinlikle fark ettik). Bir önceden eğitilmiş model olarak, bazı önemli görevlerde⁴ en ileri ABD modellerinin performansına yaklaşır gibi görünüyor, üstelik eğitimi önemli ölçüde daha düşük maliyetle gerçekleştirilmiş (yine de, Claude 3.5 Sonnet’in özellikle gerçek dünya kodlama gibi bazı temel görevlerde çok daha iyi performans gösterdiğini görüyoruz). DeepSeek ekibi bunu, büyük ölçüde mühendislik verimliliğine odaklanan bazı özgün ve etkileyici yeniliklerle başardı. Özellikle “Anahtar-Değer önbelleği” (Key-Value cache) yönetiminde ve “uzman karışımı” (mixture of experts) yöntemini daha önce hiç olmadığı kadar ileriye taşımada yenilikçi gelişmeler kaydettiler.

Ancak, daha yakından bakmak önemli:

DeepSeek “6 milyon dolara, ABD yapay zeka şirketlerinin milyarlarca dolara mal ettiği şeyi yapmıyor”. Yalnızca Anthropic adına konuşabilirim, ancak Claude 3.5 Sonnet orta ölçekli bir model ve eğitimi birkaç on milyon dolara mal oldu (tam bir rakam vermeyeceğim). Ayrıca, 3.5 Sonnet’in eğitimi, daha büyük veya daha pahalı bir model kullanılarak yapılmadı (bazı söylentilerin aksine). Sonnet’in eğitimi 9-12 ay önce gerçekleştirildi ve DeepSeek’in modeli Kasım/Aralık aylarında eğitildi, buna rağmen Sonnet birçok iç ve dış değerlendirmede hâlâ belirgin şekilde önde. Bu nedenle, adil bir ifade şu olur: “DeepSeek, ABD modellerinden 7-10 ay daha eski bir modelin performansına yaklaşan bir model üretti, bunu önemli ölçüde daha düşük bir maliyetle yaptı (ancak, insanların öne sürdüğü oranlara yakın değil)”.

Eğer maliyet eğrisinin tarihsel düşüş trendi ~4x/yıl ise, bu şu anlama gelir: normal iş akışı içinde—2023 ve 2024’te yaşanan tarihsel maliyet düşüş trendleri doğrultusunda—şu anda 3.5 Sonnet/GPT-4o’ya kıyasla 3-4 kat daha ucuz bir model beklerdik. DeepSeek-V3, ABD’nin en ileri modellerinden daha kötü olduğuna göre—bunu ölçekleme eğrisinde ~2x fark olarak ele alırsak, ki bence bu DeepSeek-V3 için oldukça cömert bir değerlendirme—o zaman DeepSeek-V3’ün eğitim maliyetinin, bir yıl önce geliştirilen mevcut ABD modellerine kıyasla ~8x daha düşük olması tamamen normal ve beklenen bir durum olurdu. Bir rakam vermeyeceğim, ancak önceki maddeye dayanarak, DeepSeek’in eğitim maliyetini yüzeysel olarak ele alsak bile, en iyi ihtimalle trend dahilinde oldukları ve muhtemelen trendin gerisinde bile kaldıkları açık. Örneğin, bu fark, orijinal GPT-4 ile Claude 3.5 Sonnet’in çıkarım maliyeti farkından (10x) daha az dik bir düşüş gösteriyor ve 3.5 Sonnet, GPT-4’ten daha iyi bir model.

Tüm bunlar, DeepSeek-V3’ün benzersiz bir atılım olmadığı veya büyük dil modellerinin ekonomisini temelden değiştiren bir şey olmadığı anlamına geliyor; bu, süregelen bir maliyet düşüş eğrisinin beklenen bir noktasını temsil ediyor. Bu sefer farklı olan şey, beklenen maliyet düşüşlerini ilk kez gösteren şirketin Çinli olması. Bu daha önce hiç olmamıştı ve jeopolitik açıdan önemli bir durum. Ancak, ABD şirketleri de yakında aynı şeyi yapacak—ve bunu DeepSeek’i kopyalayarak değil, kendilerinin de olağan maliyet düşüş eğilimine ulaşmaları sayesinde gerçekleştirecekler.

Hem DeepSeek hem de ABD’li yapay zeka şirketleri, başlıca modellerini eğitmek için geçmişte kullandıklarından çok daha fazla paraya ve çok daha fazla çipe sahip. Ekstra çipler, modelin arkasındaki fikirleri geliştirmek için Ar-Ge amaçlı kullanılıyor ve bazen henüz hazır olmayan (veya doğru hale getirilmesi için birden fazla deneme gerektiren) daha büyük modelleri eğitmek için harcanıyor. Bildirildiğine göre—kesin olarak doğrulayamıyoruz—DeepSeek’in aslında 50.000 Hopper nesil çipe sahip olduğu belirtiliyor⁶ ve bunun büyük ABD’li yapay zeka şirketlerinin sahip olduğu miktarla yaklaşık 2-3 kat içinde olduğunu tahmin ediyorum (örneğin, bu miktar xAI’ın “Colossus” kümesinden 2-3 kat daha azdır)⁷. Bu 50.000 Hopper çipi yaklaşık 1 milyar dolara mal olmuştur. Dolayısıyla, DeepSeek’in bir şirket olarak toplam harcamaları (bireysel bir modelin eğitimi için yapılan harcamalardan farklı olarak) ABD’li yapay zeka laboratuvarlarının harcamalarından çok da farklı değil.

“Ölçekleme eğrisi” analizi biraz basitleştirilmiş bir değerlendirme, çünkü modeller belirli açılardan farklılaşıyor ve farklı güçlü ve zayıf yönlere sahip; ölçekleme eğrisi sayıları birçok ayrıntıyı göz ardı eden kaba bir ortalamadır. Yalnızca Anthropic’in modelleri hakkında konuşabilirim, ancak yukarıda da ima ettiğim gibi, Claude kodlamada ve insanlarla iyi tasarlanmış bir etkileşim tarzına sahip olma konusunda son derece iyidir (birçok kişi onu kişisel danışmanlık veya destek amaçlı kullanıyor). Bu ve bazı ek görevlerde, DeepSeek ile herhangi bir kıyaslama söz konusu değil. Bu faktörler ölçekleme sayılarında görünmüyor.

Geçen hafta yayımlanan ve kamuoyunda büyük yankı uyandırarak Nvidia’nın hisse senedi fiyatında ~%17’lik bir düşüşe neden olan model olan R1, yenilik veya mühendislik açısından V3 kadar ilginç değil. İkinci eğitim aşamasını—önceki bölümde #3’te açıklanan pekiştirmeli öğrenmeyi—ekliyor ve temelde OpenAI’ın o1 modeliyle yaptığını kopyalıyor (benzer ölçek ve benzer sonuçlarla görünüyorlar)⁸. Ancak, ölçekleme eğrisinin erken aşamasında olduğumuz için, birkaç şirketin bu tür modeller üretmesi mümkün, yeter ki güçlü bir önceden eğitilmiş modelle başlasınlar. V3’ü baz alarak R1’i üretmek muhtemelen çok ucuzdu. Dolayısıyla, ilginç bir “geçiş noktasındayız”, yani geçici olarak birkaç şirketin iyi akıl yürütme modelleri üretebilmesi mümkün. Ancak, herkes bu modellerin ölçekleme eğrisinde daha yukarılara çıktıkça, bu durum hızla değişecek.

İhracat Kontrolleri

Tüm bunlar aslında benim esas ilgilendiğim konu olan Çin’e çip ihracatı üzerindeki kontrollerin bir önsözü niteliğinde. Yukarıdaki gerçekler ışığında durumu şu şekilde görüyorum:

Şirketlerin güçlü yapay zeka modelleri eğitmek için giderek daha fazla harcama yaptığı sürekli bir eğilim var; eğri periyodik olarak kaydırılsa ve belirli bir zeka seviyesindeki modelin eğitme maliyeti hızla düşse bile. Ancak, daha akıllı modellerin eğitiminin ekonomik değeri o kadar büyük ki, maliyet avantajları neredeyse anında ortadan kalkıyor—bu kazançlar, başlangıçta harcamayı planladığımız aynı büyük bütçelerle daha da akıllı modeller üretmeye yönlendiriliyor. ABD laboratuvarlarının henüz keşfetmediği verimlilik yeniliklerini DeepSeek’in geliştirmiş olması ihtimali dahilinde bile, bu yenilikler kısa sürede hem ABD hem de Çin laboratuvarları tarafından milyarlarca dolarlık modelleri eğitmek için uygulanacaktır. Bu modeller, önceki milyar dolarlık modellere kıyasla daha iyi performans gösterecek—ancak yine de milyarlarca dolar harcanacak. Bu rakam artmaya devam edecek ve sonunda hemen hemen her konuda insanlardan daha akıllı bir yapay zekaya ulaşacağız.

Hemen hemen her konuda insanlardan daha akıllı bir yapay zeka üretmek milyonlarca çip, on milyarlarca dolar (en az) gerektirecek ve bunun en olası zaman aralığı 2026-2027 olacak. DeepSeek’in duyurduğu modeller bu gerçeği değiştirmiyor, çünkü maliyet düşüş eğrisine kabaca uyuyorlar ve bu zaten bu hesaplamalara dahil edilmişti.

Bu da şu anlama geliyor: 2026-2027 yıllarında iki çok farklı dünyadan birinde olabiliriz. ABD’de, birden fazla şirketin gerekli milyonlarca çipe kesinlikle sahip olacağı (on milyarlarca dolara mal olsa bile) aşikâr. Soru şu: Çin de milyonlarca çipe ulaşabilecek mi⁹?

Eğer ulaşabilirse, ABD ve Çin’in güçlü yapay zeka modellerine sahip olacağı, bilim ve teknolojide aşırı hızlı ilerlemelere yol açacak “iki kutuplu” bir dünyada yaşayacağız—buna “veri merkezinde dâhiler ülkeleri” adını veriyorum. Ancak, iki kutuplu bir dünya sonsuza kadar dengede kalmayabilir. ABD ve Çin yapay zeka sistemlerinde eşit düzeyde olsalar bile, Çin’in bu teknolojinin askeri uygulamalarına daha fazla yetenek, sermaye ve odaklanma ayırabileceği görülüyor. Bunu, büyük sanayi temeli ve askeri-stratejik avantajlarıyla birleştirdiğimizde, bu durumun Çin’in küresel arenada yalnızca yapay zeka alanında değil, her alanda belirleyici bir liderlik elde etmesine yardımcı olması mümkün.

Eğer Çin milyonlarca çipe ulaşamazsa, (en azından geçici olarak) tek kutuplu bir dünyada yaşayacağız; bu dünyada yalnızca ABD ve müttefikleri bu modellere sahip olacak. Tek kutuplu dünyanın ne kadar süreceği belirsiz, ancak yapay zeka sistemlerinin zamanla daha akıllı yapay zeka sistemleri geliştirmeye yardımcı olabileceği düşünüldüğünde, geçici bir üstünlüğün kalıcı bir avantaja dönüştürülebileceği ihtimali var¹⁰. Dolayısıyla, bu senaryoda ABD ve müttefikleri küresel sahnede belirleyici ve uzun vadeli bir liderlik elde edebilir.

Çin’in milyonlarca çipe ulaşmasını engelleyebilecek tek şey sıkı bir şekilde uygulanan ihracat kontrolleridir¹¹ ve dolayısıyla, dünyanın tek kutuplu mu yoksa iki kutuplu mu olacağını belirleyen en önemli faktördür.

DeepSeek’in performansı, ihracat kontrollerinin başarısız olduğu anlamına gelmiyor. Yukarıda belirttiğim gibi, DeepSeek orta ila büyük ölçekte çiplere sahipti, dolayısıyla güçlü bir model geliştirip eğitebilmeleri şaşırtıcı değil. ABD’li yapay zeka şirketlerine kıyasla ciddi anlamda kaynak kısıtlamaları yaşamadılar ve ihracat kontrolleri onların “yenilikçi” olmalarını sağlayan temel etken değildi. Sadece çok yetenekli mühendislerden oluşan bir ekipleri var ve bu da Çin’in ABD’ye karşı ciddi bir rakip olduğunu gösteriyor.

DeepSeek ayrıca, Çin’in her zaman ihtiyaç duyduğu çipleri kaçakçılık yoluyla elde edebileceğini ya da ihracat kontrollerinin her zaman açıklar barındırdığını da göstermiyor. İhracat kontrollerinin, Çin’in on binlerce çipe ulaşmasını engellemek için tasarlandığını düşünmüyorum. 1 milyar dolarlık ekonomik faaliyet gizlenebilir, ancak 100 milyar dolar veya hatta 10 milyar dolar gizlemek zordur. Bir milyon çipi kaçırmak da fiziksel olarak zor olabilir. DeepSeek’in şu anda sahip olduğu çipleri incelemek de öğretici bir yaklaşımdır. SemiAnalysis’e göre, ellerinde toplam 50 bin adet H100, H800 ve H20 çipi bulunuyor. H100’ler piyasaya sürüldüklerinden beri ihracat kontrolleri kapsamında yasaklı, dolayısıyla DeepSeek’in elinde H100 varsa bunlar kaçakçılıkla edinilmiş olmalı (bu noktada Nvidia, DeepSeek’in ilerlemelerinin “tamamen ihracat kontrollerine uygun” olduğunu belirtmiştir). H800’ler, 2022’deki ilk ihracat kontrol düzenlemeleri kapsamında izinliydi, ancak Ekim 2023’te kontroller güncellendiğinde yasaklandı, dolayısıyla bunlar muhtemelen yasak gelmeden önce gönderildi. H20’ler ise eğitim açısından daha az verimli, ancak çıkarım işlemleri için daha verimli—ve hâlâ izinli, ancak bence yasaklanmaları gerekiyor. Tüm bunlar, DeepSeek’in çip filosunun önemli bir kısmının henüz yasaklanmamış (ancak yasaklanması gereken) çiplerden, yasaklanmadan önce gönderilmiş çiplerden ve kaçakçılıkla edinilmiş olması muhtemel çiplerden oluştuğunu gösteriyor. Bu da ihracat kontrollerinin aslında çalıştığını ve adapte olduğunu kanıtlıyor: açıklar kapatılıyor; aksi takdirde, muhtemelen tamamen H100’lerden oluşan bir filoları olurdu. Eğer bu açıkları yeterince hızlı kapatabilirsek, Çin’in milyonlarca çipe ulaşmasını engelleyebilir ve ABD’nin önde olduğu tek kutuplu bir dünyanın olasılığını artırabiliriz.

İhracat kontrollerine ve ABD ulusal güvenliğine odaklanmam nedeniyle, bir noktayı netleştirmek istiyorum. DeepSeek’i doğrudan bir düşman olarak görmüyorum ve mesele onları özellikle hedef almak değil. Verdikleri röportajlara bakılırsa, onlar sadece faydalı teknoloji geliştirmek isteyen zeki ve meraklı araştırmacılar gibi görünüyorlar.

Ancak, insan hakları ihlallerinde bulunmuş, dünya sahnesinde saldırgan davranmış ve yapay zeka alanında ABD ile eşit seviyeye gelirse bu eylemlerinde çok daha az kısıtlanacak olan otoriter bir hükümete bağlılar. İhracat kontrolleri, bunu önlemek için elimizdeki en güçlü araçlardan biri ve teknolojinin daha güçlü hale gelmesi, daha verimli olması, ihracat kontrollerini gevşetmek için bir gerekçe oluşturmuyor.

Dipnotlar

¹Bu yazıda Batılı modellerden damıtma yapıldığına dair raporlar hakkında herhangi bir görüş belirtmiyorum. Burada, DeepSeek’in makalede belirttiği şekilde eğitimi gerçekleştirdiğini varsayıyorum. ↩

²Bu arada, DeepSeek modellerinin yayımlanmasının Nvidia için kesinlikle kötü olmadığına inanıyorum ve bu haberin Nvidia’nın hisse senedinde çift haneli (~%17) bir düşüşe neden olmasının anlaşılmaz olduğunu düşünüyorum. Bu duyurunun Nvidia için kötü olmadığı argümanı, bunun yapay zeka şirketleri için kötü olmadığı argümanından bile daha açık. Ancak, bu yazıdaki asıl amacım ihracat kontrol politikalarını savunmaktır. ↩

³Tam olarak belirtmek gerekirse, bu model, akıl yürütme paradigması değişiminden önceki modellerde yaygın olan çok küçük miktarda RL eğitimi içeren bir önceden eğitilmiş modeldi. ↩

⁴Bazı çok dar görevlerde daha güçlüdür. ↩

⁵Bu, DeepSeek’in makalesinde belirtilen rakam—bunu olduğu gibi kabul ediyorum ve yalnızca ABD’li şirketlerin model eğitme maliyetleriyle yapılan karşılaştırmaya ve belirli bir modeli eğitmenin maliyeti (6 milyon dolar) ile genel Ar-Ge maliyeti (çok daha yüksek) arasındaki farka itiraz ediyorum. Ancak, 6 milyon dolarlık rakamdan tamamen emin olmamız da mümkün değil—model boyutu doğrulanabilir, ancak token sayısı gibi diğer faktörler doğrulanamaz. ↩

⁶ Bazı röportajlarda DeepSeek’in “50.000 H100 çipi” olduğunu söyledim, ancak bu, raporlamanın ince bir şekilde yanlış bir özetiydi ve burada düzeltmek istiyorum. En çok bilinen “Hopper çipi” açık ara H100’dür (ben de bu çipin kastedildiğini varsaymıştım), ancak Hopper serisi ayrıca H800 ve H20 modellerini de içeriyor ve DeepSeek’in üçünden de belli oranlarda sahip olduğu, toplamda 50.000 çipe ulaştığı bildiriliyor. Bu durum genel tabloyu pek değiştirmese de düzeltmeye değer bir ayrıntı. İhracat kontrolleri hakkında konuşurken H800 ve H20 çipleri üzerinde daha fazla duracağım. ↩

⁷ Not: İhracat kontrolleri nedeniyle bir sonraki nesil küme sistemlerinde bu farkın önemli ölçüde büyüyeceğini tahmin ediyorum. ↩

⁸ R1 modelinin bu kadar dikkat çekmesinin başlıca nedenlerinden birinin, modelin sergilediği düşünce zinciri akıl yürütmesini doğrudan kullanıcıya gösteren ilk model olması olduğunu düşünüyorum (OpenAI’ın o1 modeli yalnızca nihai cevabı gösteriyor). DeepSeek, kullanıcıların bu özelliği ilginç bulduğunu gösterdi. Açık olmak gerekirse, bu yalnızca bir kullanıcı arayüzü tercihi olup modelin kendisiyle doğrudan ilgili değildir. ↩

⁹ Çin’in kendi çiplerinin, yakın zamanda ABD üretimi çiplerle rekabet edebilecek seviyeye ulaşamayacağını unutmayın. Matt Pottinger ile yazdığım son makalede belirttiğim gibi: “Çin’in en iyi yapay zeka çipleri, Huawei Ascend serisi, ABD merkezli Nvidia tarafından üretilen en ileri çipe kıyasla önemli ölçüde daha düşük kapasiteye sahip. Ayrıca, Çin’in artan talebe ayak uydurabilecek üretim kapasitesine sahip olup olmadığı da belirsiz. Bugün Çin dışında kayda değer hiçbir Huawei Ascend çip kümesi bulunmuyor; bu da Çin’in kendi iç talebini karşılamakta zorlandığını gösteriyor…”. ↩

¹⁰ Açık olmak gerekirse, buradaki amaç Çin’i veya herhangi bir otoriter ülkeyi, güçlü yapay zeka sistemlerinin bilim, tıp, yaşam kalitesi vb. alanlarda sağlayacağı muazzam faydalardan mahrum bırakmak değildir. Yapay zekadan herkesin faydalanabilmesi gerekir. Amaç, bu ülkelerin askeri üstünlük kazanmasını engellemektir. ↩

¹¹ Birden fazla düzenleme dalgası olduğu için birçok bağlantı var. Başlıca önlemlerden bazılarını kapsamak adına: Bir, iki, üç, dört. ↩

1 Yorum

Filed under Eviri

One response to “DeepSeek ve İhracat Kontrolleri Üzerine — Dario Amodei”

  1. Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER