Çinli Yapay Zeka Girişimi DeepSeek, OpenAI’ye Rakip Bir Model Nasıl Geliştirdi

🦋🤖 Robo-Spun by IBF 🦋🤖

Wired

Çinli bir nicel hedge fonu kurucusu olan Liang Wenfeng, yapay zeka araştırmalarına yöneldiğinde, 10.000 Nvidia çipini bir araya getirdi ve genç, hırslı yeteneklerden oluşan bir ekip kurdu. İki yıl sonra DeepSeek, sahneye güçlü bir şekilde giriş yaptı.

20 Ocak’ta, Çin’den nispeten tanınmamış bir yapay zeka araştırma laboratuvarı olan DeepSeek, Silikon Vadisi’nde hızla ilgi odağı haline gelen açık kaynaklı bir model yayımladı. Şirketin yazdığı bir makaleye göre, DeepSeek-R1, matematik ve akıl yürütme alanlarında OpenAI o1 gibi sektörün önde gelen modellerini birçok kriterde geride bırakıyor. Dahası, yetenek, maliyet ve açıklık gibi önemli ölçütlerde DeepSeek, Batılı yapay zeka devlerine ciddi bir rekabet sunuyor.

DeepSeek’in başarısı, ABD ve Çin arasındaki teknoloji soğuk savaşının beklenmeyen bir sonucunu işaret ediyor. ABD’nin ihracat kontrolleri, Çinli teknoloji şirketlerinin yapay zeka konusunda Batılıların yöntemlerini taklit ederek, yani daha fazla çip satın alıp daha uzun süre eğitim yaparak sınırsız bir şekilde ölçeklenmesini ciddi şekilde engelledi. Bunun sonucunda, çoğu Çinli şirket, kendi modellerini oluşturmak yerine alt uygulamalara odaklanmak zorunda kaldı. Ancak DeepSeek’in son yayımladığı model, başka bir kazanma yolunu kanıtlıyor: Yapay zeka modellerinin temel yapısını yeniden tasarlayarak ve sınırlı kaynakları daha verimli kullanarak başarıya ulaşmak.

“Gelişmiş donanımlara erişime büyük ölçüde bel bağlayan birçok Çinli yapay zeka firmasının aksine, DeepSeek yazılım odaklı kaynak optimizasyonunu maksimize etmeye odaklandı,” diyor Çin yeniliklerini araştıran Sydney Teknoloji Üniversitesi’nden doçent Marina Zhang. “DeepSeek, açık kaynak yöntemlerini benimseyerek kolektif uzmanlıkları bir araya getirdi ve iş birliğine dayalı yeniliği teşvik etti. Bu yaklaşım, kaynak kısıtlamalarını hafifletmekle kalmıyor, aynı zamanda ileri teknolojilerin geliştirilmesini hızlandırarak DeepSeek’i daha kapalı rakiplerinden ayırıyor.”

Peki, yapay zeka girişiminin arkasındaki kişiler kim? Ve neden bir anda sektörün önde gelen bir modelini geliştirip bunu ücretsiz olarak yayımlıyorlar? WIRED, Çin’in yapay zeka endüstrisi üzerine çalışan uzmanlarla görüştü ve DeepSeek’in kurucusu Liang Wenfeng ile yapılmış detaylı röportajları inceleyerek, şirketin yıldırım hızıyla yükselişinin ardındaki hikâyeyi bir araya getirdi. DeepSeek, WIRED’ın gönderdiği birkaç sorguya yanıt vermedi.

Çin’de Yıldızlaşan Bir Hedge Fon
Çin yapay zeka endüstrisi içinde bile, DeepSeek sıra dışı bir oyuncu. Bu şirket, Çin’in en başarılı nicel hedge fonlarından biri olan High-Flyer’ın derin öğrenme araştırma kolu Fire-Flyer olarak başladı. 2015 yılında kurulan hedge fon, Çin’de hızla yükselerek 100 milyar RMB’den (yaklaşık 15 milyar dolar) fazla fon toplayan ilk nicel hedge fon oldu. (2021’den bu yana bu rakam yaklaşık 8 milyar dolara düşmüş olsa da, High-Flyer ülkenin en önemli nicel hedge fonlarından biri olmaya devam ediyor.)

Yıllarca High-Flyer, finansal verileri analiz etmek için GPU’lar biriktirdi ve Fire-Flyer süper bilgisayarlarını geliştirdi. Ardından, 2023 yılında, bilgisayar bilimleri alanında yüksek lisansa sahip olan Liang, fonun kaynaklarını DeepSeek adında yeni bir şirkete aktarmaya karar verdi. Bu şirket, kendi ileri düzey modellerini geliştirecek ve umarız ki genel yapay zeka üretecekti. Bu, sanki Jane Street’in bir yapay zeka girişimi haline gelip nakit parasını bilimsel araştırmaya harcamaya karar vermesi gibiydi.

Cesur bir vizyon. Ama bir şekilde işe yaradı. “DeepSeek, kısa vadeli ticari kazançlardan çok uzun vadeli teknolojik ilerlemeyi önceliklendiren yeni nesil Çinli teknoloji şirketlerini temsil ediyor,” diyor Zhang.

Liang, Çinli teknoloji yayını 36Kr’a yaptığı açıklamada, bu kararın kâr elde etme arzusundan ziyade bilimsel merakla yönlendirildiğini belirtti. “Beni buna ticari bir neden bulmaya zorlarsanız, bulamam,” dedi. “Çünkü ticari açıdan buna değmez. Temel bilim araştırmalarının yatırım getiri oranı çok düşüktür. OpenAI’nin erken yatırımcıları onlara para verirken ne kadar kazanç elde edeceklerini düşünmüyorlardı. Bunun yerine, gerçekten bu işi yapmak istiyorlardı.”

Bugün, DeepSeek, Baidu, Alibaba veya ByteDance gibi teknoloji devlerinden fon almadan faaliyet gösteren Çin’deki az sayıdaki önde gelen yapay zeka şirketlerinden biri.

Kendini Kanıtlamaya Hevesli Genç Bir Dahi Grubu
Liang’a göre, DeepSeek’in araştırma ekibini oluştururken, kullanıcı odaklı bir ürün geliştirmek için deneyimli mühendisler aramıyordu. Bunun yerine, Pekin Üniversitesi ve Tsinghua Üniversitesi gibi Çin’in en iyi üniversitelerinden doktora öğrencilerine odaklandı. Bu öğrenciler kendilerini kanıtlamaya hevesliydi. Çin teknoloji yayını QBitAI’ye göre, birçoğu üst düzey akademik dergilerde makaleler yayımlamış ve uluslararası akademik konferanslarda ödüller kazanmıştı, ancak sektör deneyimleri bulunmuyordu.

“Çekirdek teknik pozisyonlarımızın çoğu, bu yıl ya da son bir iki yıl içinde mezun olmuş kişiler tarafından dolduruluyor,” diye açıkladı Liang, 2023 yılında 36Kr’a verdiği bir röportajda. Bu işe alım stratejisi, çalışanların alışılmışın dışında araştırma projelerini takip etmek için geniş bilgi işlem kaynaklarını özgürce kullanabildiği iş birliğine dayalı bir şirket kültürü yarattı. Bu, Çin’deki yerleşik internet şirketlerinden oldukça farklı bir çalışma tarzıydı; burada ekipler genellikle kaynaklar için rekabet ediyor. (Yakın bir örnek: ByteDance, prestijli bir akademik ödül kazanmış eski bir stajyeri, kendi ekibi için daha fazla bilgi işlem kaynağı elde etmek adına meslektaşlarının çalışmalarını sabote etmekle suçladı.)

Liang, öğrencilerin yüksek yatırım ve düşük kârlı araştırmalar için daha uygun olabileceğini belirtti. “Çoğu insan, gençken, faydacı kaygılardan bağımsız olarak kendini tamamen bir misyona adayabilir,” diye açıkladı. Potansiyel çalışanlara yaptığı sunumda, DeepSeek’in “dünyadaki en zor soruları çözmek” için kurulduğunu söyledi.

Uzmanlara göre, bu genç araştırmacıların neredeyse tamamen Çin’de eğitim görmüş olmaları, onların motivasyonunu artırıyor. “Bu genç nesil, özellikle ABD’nin kritik donanım ve yazılım teknolojilerinde koyduğu kısıtlamalarla karşılaşırken, bir yurtseverlik duygusunu da barındırıyor,” diyor Zhang. “Bu engelleri aşma kararlılıkları, sadece kişisel bir hırsı değil, aynı zamanda Çin’in küresel bir yenilik lideri olarak konumunu ilerletme taahhüdünü de yansıtıyor.”

Bir Krizden Doğan Yenilik
Ekim 2022’de, ABD hükümeti, Nvidia’nın H100 gibi ileri düzey çiplere Çinli yapay zeka şirketlerinin erişimini ciddi şekilde sınırlayan ihracat kontrollerini oluşturmaya başladı. Bu adım, DeepSeek için bir sorun teşkil etti. Şirket, 10.000 H100 yığınıyla işe başlamıştı, ancak OpenAI ve Meta gibi firmalarla rekabet etmek için daha fazlasına ihtiyaç duyuyordu. “Karşı karşıya olduğumuz problem hiçbir zaman finansman olmadı, ancak ileri düzey çiplerin ihracat kontrolü oldu,” dedi Liang, 2024 yılında 36Kr ile yaptığı ikinci röportajda.

DeepSeek, modellerini eğitmek için daha verimli yöntemler geliştirmek zorunda kaldı. “Çipler arasındaki iletişim için özel tasarlanmış iletişim düzenleri, bellek tasarrufu için alanların boyutlarını küçültme ve modellerin karışımının yenilikçi kullanımı gibi bir dizi mühendislik yöntemiyle model mimarilerini optimize ettiler,” diyor Mercator Çin Araştırmaları Enstitüsü’nde politika analisti olarak çalışan ve geçmişte yazılım mühendisi olan Wendy Chang. “Bu yaklaşımların çoğu yeni fikirler değil, ancak bunları başarılı bir şekilde bir araya getirip ileri düzey bir model oluşturmak dikkate değer bir başarıdır.”

DeepSeek, ayrıca Multi-head Latent Attention (MLA) ve Mixture-of-Experts üzerine önemli ilerlemeler kaydetti. Bu iki teknik tasarım, DeepSeek modellerini eğitmek için daha az bilgi işlem kaynağı gerektirerek daha maliyet etkin hale getiriyor. Hatta, DeepSeek’in en son modeli, Meta’nın benzer Llama 3.1 modelini eğitmek için gereken bilgi işlem gücünün onda birini kullanarak eğitildi, Epoch AI araştırma enstitüsüne göre.

DeepSeek’in bu yenilikleri kamuoyuyla paylaşma isteği, küresel yapay zeka araştırma topluluğu içinde ona önemli bir itibar kazandırdı. Pek çok Çinli yapay zeka şirketi için, açık kaynak modeller geliştirmek Batılı rakipleriyle yarışabilmenin tek yolu, çünkü bu, daha fazla kullanıcı ve katkıda bulunan çekiyor ve bu da modellerin büyümesine yardımcı oluyor. “Artık daha az, ancak hâlâ çokça para kullanarak ileri düzey modellerin inşa edilebileceğini ve mevcut model oluşturma normlarının optimizasyon için bolca alan bıraktığını gösterdiler,” diyor Chang. “Bu yönde çok daha fazla girişim göreceğimizden eminiz.”

Bu haber, Çin’de bilgi işlem kaynaklarını daraltmaya odaklanan mevcut ABD ihracat kontrolleri için sorun teşkil edebilir. “Çin’in elinde ne kadar yapay zeka bilgi işlem gücü olduğu ve bununla ne başarabileceğine dair mevcut tahminler altüst olabilir,” diyor Chang.

1 Yorum

Filed under Eviri

One response to “Çinli Yapay Zeka Girişimi DeepSeek, OpenAI’ye Rakip Bir Model Nasıl Geliştirdi”

  1. Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER