🦋🤖 Robo-Spun by IBF 🦋🤖
Çinli firma, en iyi laboratuvarların bir sonraki nesil modellerini nasıl inşa ettiğini ortaya çıkarmak için perdeyi araladı. Şimdi işler ilginçleşiyor.
Will Douglas Heaven
31 Ocak 2025
Geçen hafta Çinli firma DeepSeek, R1 adlı büyük bir dil modeli yayınladığında, ABD teknoloji sektöründe şok dalgaları yarattı. R1 yalnızca yerli rakiplerinin en iyileriyle eşleşmekle kalmadı, aynı zamanda çok daha düşük bir maliyetle inşa edildi—ve ücretsiz olarak dağıtıldı.
ABD borsası 1 trilyon dolar kaybetti, Başkan Trump bunu bir uyandırma çağrısı olarak nitelendirdi ve beklentiler yeniden tavan yaptı. “DeepSeek R1, gördüğüm en şaşırtıcı ve etkileyici atılımlardan biri—ve açık kaynak olarak dünyaya muazzam bir armağan,” diye yazdı Silikon Vadisi’nin önde gelen yatırımcılarından Marc Andreessen, X’te.
Ancak DeepSeek’in yenilikleri buradaki tek önemli nokta değil. R1 ve önceki modeli V3’ün nasıl inşa edildiğine dair ayrıntıları yayınlayarak ve modelleri ücretsiz olarak sunarak DeepSeek, akıl yürütme modellerinin sanıldığı kadar zor olmadığını gösterdi. Şirket, dünyanın en üst düzey laboratuvarlarıyla aradaki farkı kapattı.
Bu haber, rakipleri harekete geçirdi. Bu hafta Çinli teknoloji devi Alibaba, büyük dil modeli Qwen’in yeni bir sürümünü duyurdu ve ABD’li kar amacı gütmeyen öncü laboratuvarlardan Allen Institute for AI (AI2), büyük dil modeli Tulu’yu güncellediğini açıkladı. Her ikisi de en yeni modellerinin DeepSeek’in eşdeğerinden daha iyi olduğunu iddia ediyor.
OpenAI’ın kurucu ortağı ve CEO’su Sam Altman, R1’in etkileyici olduğunu kabul etti—fiyatına göre—ancak iddialı bir vaatle karşılık verdi: “Açıkçası, çok daha iyi modeller sunacağız.” OpenAI, bunun hemen ardından ABD hükümet kurumlarının güvenlik ihtiyaçlarına özel olarak tasarlanmış ChatGPT Gov’u piyasaya sürdü. Bu, DeepSeek’in uygulamasının verileri Çin’e gönderdiğine dair endişelere yönelik bir hamle olarak görüldü. Daha fazlası da yolda.
DeepSeek aniden yenilmesi gereken şirket haline geldi. Teknoloji dünyasını bu kadar sarsacak ne yaptı? Beklentiler gerçekçi mi? Ve bu heyecandan geleceğe dair ne öğrenebiliriz? İşte bilmeniz gerekenler.
Eğitim adımları
Öncelikle büyük dil modellerinin nasıl eğitildiğini açalım. İki ana aşama vardır: ön eğitim (pretraining) ve son eğitim (post-training). İnsanların en çok konuştuğu kısım ön eğitimdir. Bu süreçte milyarlarca belge—devasa miktarda web sitesi, kitap, kod deposu ve daha fazlası—bir sinir ağına tekrar tekrar beslenir. Amaç, modelin kaynak materyali gibi görünen metinler üretmeyi öğrenmesidir ve bu, kelime kelime gerçekleşir. Sonuçta elde edilen modele “temel model” (base model) denir.
Ön eğitim, işin en büyük kısmının gerçekleştiği aşamadır ve muazzam miktarda paraya mal olabilir. Ancak OpenAI’ın kurucu ortaklarından ve Tesla’nın eski yapay zeka başkanı Andrej Karpathy, geçen yıl Microsoft Build etkinliğinde yaptığı bir konuşmada şunu vurgulamıştı: “Temel modeller asistan değildir. Onlar sadece internet belgelerini tamamlamak ister.”
Büyük bir dil modelini faydalı bir araca dönüştürmek için birkaç ek adım gerekir. Bu, modelin belirli görevleri yerine getirmeyi öğrendiği son eğitim aşamasıdır—örneğin soruları yanıtlamak (veya OpenAI’ın o3 ve DeepSeek’in R1’inde olduğu gibi adım adım cevap vermek). Son birkaç yıldır bu işlem, temel modelin, insan testçiler tarafından sağlanan soru-cevap örneklerini taklit edecek şekilde eğitilmesiyle gerçekleştiriliyor. Bu adıma “gözetimli ince ayar” (supervised fine-tuning) denir.
OpenAI, daha sonra modeli bir adım ileri götürdü: Modelin verdiği örnek yanıtlar, yine insan testçiler tarafından puanlandı ve bu puanlar, modelin gelecekte yüksek puan alan yanıtlar üretmesini sağlamak üzere kullanıldı. Bu teknik, “insan geri bildirimiyle pekiştirmeli öğrenme” (reinforcement learning with human feedback, RLHF) olarak bilinir ve ChatGPT gibi sohbet botlarını bu kadar akıcı yapan şey budur. RLHF artık sektörde yaygın olarak kullanılmaktadır.
Ancak bu son eğitim adımları zaman alır. DeepSeek’in gösterdiği şey ise aynı sonuçların, insanları hiç kullanmadan—en azından çoğu durumda—elde edilebileceğidir. DeepSeek, gözetimli ince ayar ve RLHF yerine tamamen otomatik bir pekiştirmeli öğrenme adımı kullanıyor. İnsan geri bildirimleriyle modellerini yönlendirmek yerine, firma bilgisayar tarafından üretilen geri bildirim puanlarını kullanıyor.
“İnsan geri bildirimini atlamak veya en aza indirmek—bu büyük bir olay,” diyor eski Alibaba araştırma direktörü ve şu anda İsrail merkezli yapay zeka kodlama girişimi Qodo’nun kurucu ortağı ve CEO’su olan Itamar Friedman. “Neredeyse tamamen insan emeği gerektirmeden model eğitiyorsunuz.”
Ucuz iş gücü
Bu yaklaşımın dezavantajı, bilgisayarların matematik ve kod hakkındaki soruların yanıtlarını puanlamada başarılı olmalarına rağmen, açık uçlu veya daha öznel soruların yanıtlarını puanlamada pek iyi olmamalarıdır. Bu nedenle R1, özellikle matematik ve kod testlerinde iyi performans göstermektedir. DeepSeek, modellerini daha geniş bir yelpazede matematik dışı soruları yanıtlamaya veya yaratıcı görevleri yerine getirmeye eğitmek için hâlâ insanlardan geri bildirim almalıdır.
Ancak, bu bile Çin’de daha ucuzdur. “Batı pazarlarına kıyasla, yüksek kaliteli veri oluşturmanın maliyeti Çin’de daha düşüktür ve matematik, programlama veya mühendislik alanlarında üniversite diplomasına sahip daha büyük bir yetenek havuzu vardır,” diyor Avustralyalı yapay zeka firması Appen’in başkan yardımcısı ve daha önce Amazon Web Services China ile Çinli teknoloji devi Tencent’in strateji başkanı olarak görev yapmış olan Si Chen.
DeepSeek, bu yaklaşımı kullanarak OpenAI’ın amiral gemisi modeli GPT-4o ile rekabet eden bir temel model geliştirdi. V3 olarak adlandırılan bu model, firma tarafından bir ay önce yayınlandı. Geçen hafta duyurulan ve OpenAI’ın o1 modeliyle eşleşen yeni model R1, V3 üzerine inşa edildi.
R1’i oluşturmak için DeepSeek, V3’ü aldı ve pekiştirmeli öğrenme döngüsünü defalarca çalıştırdı. 2016 yılında Google DeepMind, bu tür otomatik deneme-yanılma yaklaşımının, hiçbir insan girdisi olmadan, rastgele hamleler yapan bir tahta oyunu modelini eğiterek büyükustaları yenebilecek hâle getirebileceğini göstermişti. DeepSeek, büyük dil modellerinde benzer bir şey yapıyor: Potansiyel yanıtlar, bir oyundaki olası hamleler gibi ele alınıyor.
Başlangıçta model, DeepSeek’in istediği gibi bir soruyu adım adım çözen yanıtlar üretmiyordu. Ancak modelin örnek yanıtlarını otomatik olarak puanlayarak, eğitim süreci onu kademeli olarak istenen davranışa yönlendirdi.
Sonunda DeepSeek, çeşitli kıyaslamalarda (benchmark) iyi performans gösteren bir model üretti. Ancak bu model, R1-Zero olarak adlandırılan versiyon, okunması zor yanıtlar veriyor ve birden fazla dili karışık kullanıyordu. Son bir ince ayar yapmak için DeepSeek, pekiştirmeli öğrenme sürecini, insanların sağladığı örnek yanıtları içeren küçük bir veri kümesiyle başlattı. R1-Zero’nun bu veri setiyle eğitilmesi, DeepSeek’in R1 adını verdiği nihai modeli ortaya çıkardı.
Daha fazlası da var. Pekiştirmeli öğrenmeyi mümkün olduğunca verimli kullanmak için DeepSeek, Grup Göreli Politika Optimizasyonu (Group Relative Policy Optimization, GRPO) adlı yeni bir algoritma geliştirdi. Firma, GRPO’yu ilk kez bir yıl önce, DeepSeekMath adlı modeli oluşturmak için kullandı.
Ayrıntıları geçelim—bilmeniz gereken tek şey, pekiştirmeli öğrenmenin, olası bir hamlenin iyi mi kötü mü olduğunu belirlemek için bir puan hesaplamayı içerdiğidir. Mevcut pekiştirmeli öğrenme tekniklerinin çoğu, bu hesaplamayı yapmak için tamamen ayrı bir modele ihtiyaç duyar. Büyük dil modelleri söz konusu olduğunda, bu ikinci modelin inşa edilmesi ve çalıştırılması ilk model kadar pahalı olabilir. GRPO ise ikinci bir model kullanmak yerine, yalnızca mantıklı bir tahminde bulunur. Bu yöntem ucuzdur, ancak hâlâ yeterince doğrudur.
Yaygın bir yaklaşım
DeepSeek’in pekiştirmeli öğrenmeyi kullanımı, firmanın R1 makalesinde öne çıkardığı temel yeniliktir. Ancak DeepSeek, bu teknikle deney yapan tek firma değildir. R1 yayınlanmadan iki hafta önce, Microsoft Asya’daki bir ekip, benzer bir şekilde eğitilmiş rStar-Math adlı bir model duyurdu. “Benzer şekilde büyük performans sıçramaları sağlıyor,” diyor yapay zeka firması Clarifai’nin kurucusu ve CEO’su Matt Zeiler.
AI2’nin Tulu modeli de verimli pekiştirmeli öğrenme teknikleri kullanılarak geliştirildi—ancak gözetimli ince ayar (supervised fine-tuning) ve RLHF gibi insan odaklı adımların yerine değil, bunlara ek olarak uygulandı. ABD merkezli Hugging Face ise, DeepSeek’in modelini kopyalayarak R1’in bileşenlerini daha ayrıntılı şekilde açığa çıkarmayı umduğu OpenR1 projesiyle R1’i yeniden üretme yarışına girdi.
Dahası, OpenAI, Google DeepMind ve Anthropic gibi önde gelen firmaların, DeepSeek’in yaklaşımının kendi versiyonlarını zaten kullanıyor olabileceği, sektör içinde bilinen bir sır. “Muhtemelen neredeyse aynı şeyi yapıyorlar, ancak kendi tarzlarına göre uyarlıyorlar,” diyor Zeiler.
Ancak DeepSeek’in elinde tek bir koz yok. Firma, temel modeli V3’ü, bir dizi kelimeyi tek tek tahmin etmek yerine bir bütün olarak tahmin etmeyi öğrenen çoklu token tahmini (multi-token prediction) yapacak şekilde eğitti. Bu eğitim daha ucuzdur ve doğruluğu artırdığı da ortaya çıkmıştır. “Konuşurken bir cümlenin yarısına geldiğinizde, geri kalanının nasıl tamamlanacağını bilirsiniz,” diyor Zeiler. “Bu modellerin de bunu yapabiliyor olması gerekir.”
DeepSeek ayrıca büyük veri kümeleri oluşturmanın daha ucuz yollarını da buldu. Geçen yılın modeli DeepSeekMath’i eğitmek için, internetten kazınmış muazzam miktarda belge içeren ücretsiz bir veri kümesi olan Common Crawl’ı aldı ve yalnızca matematik problemleri içeren belgeleri çıkarmak için otomatik bir süreç kullandı. Bu, matematik problemlerini elle içeren yeni bir veri kümesi oluşturmaktan çok daha ucuzdu. Aynı zamanda daha etkiliydi: Common Crawl, mevcut herhangi bir özel matematik veri kümesinden çok daha fazla matematik içermektedir.
Donanım tarafında ise DeepSeek, eski çipleri daha verimli kullanmanın yollarını bularak, piyasadaki en yeni donanımlara büyük paralar harcamadan üst düzey modelleri eğitmeyi başardı. “İnovasyonlarının yarısı doğrudan mühendislikten geliyor,” diyor Zeiler. “O ekipte kesinlikle gerçekten, gerçekten iyi GPU mühendisleri var.”
Nvidia, mühendislerin çiplerinin ayarlarını optimize etmek için kullandığı CUDA adlı bir yazılım sağlar. Ancak DeepSeek, bu kodu atlayarak, donanımla doğrudan iletişim kuran bir programlama dili olan assembler kullanarak Nvidia’nın kutudan çıktığı hâliyle sunduğu olanakların çok ötesine geçti. “Bu, bu işleri optimize etmenin en ileri seviyesidir,” diyor Zeiler. “Yapabilirsiniz, ancak temelde o kadar zordur ki kimse yapmaz.”
DeepSeek’in birden fazla modeldeki inovasyon serisi etkileyici. Ancak bu, şirketin V3’ü eğitmek için 6 milyon dolardan az harcadığı iddiasının hikâyenin tamamı olmadığını da gösteriyor. R1 ve V3, mevcut teknolojilerin birikimi üzerine inşa edildi. “Belki de son adım—o son düğmeye basmak—onlara 6 milyon dolara mal oldu, ancak ona götüren araştırmalar muhtemelen bunun 10 katına, belki daha fazlasına mal olmuştur,” diyor Friedman. Ve beklentilerin arasından sıyrılan bir blog yazısında, Anthropic’in kurucu ortağı ve CEO’su Dario Amodei, DeepSeek’in muhtemelen yaklaşık 1 milyar dolar değerinde çipe sahip olduğunu belirtti; bu tahmin, şirketin aslında 50.000 Nvidia H100 GPU kullandığına dair raporlara dayanıyor.
Yeni bir paradigma
Peki neden şimdi? Dünyanın dört bir yanında yüzlerce girişim bir sonraki büyük yeniliği inşa etmeye çalışıyor. Peki neden OpenAI’ın o1 ve o3’ü, Google DeepMind’in Gemini 2.0 Flash Thinking’i ve şimdi de R1 gibi bir dizi akıl yürütme modeli sadece birkaç hafta içinde ortaya çıktı?
Cevap şu ki, temel modeller—GPT-4o, Gemini 2.0, V3—artık içlerinden akıl yürütme benzeri davranışlar çıkartılabilecek kadar iyi durumda. “R1’in gösterdiği şey, yeterince güçlü bir temel modelle, insan denetimi olmadan yalnızca pekiştirmeli öğrenme kullanarak bir dil modelinden akıl yürütme elde etmenin mümkün olduğudur,” diyor Hugging Face’ten bilim insanı Lewis Tunstall.
Başka bir deyişle, önde gelen ABD firmaları bunu nasıl yapacaklarını çoktan çözmüş olabilirlerdi ancak sessiz kalmayı tercih ettiler. “Temel modelinizi, önceden eğitilmiş modelinizi alıp onu çok daha yetenekli bir akıl yürütme modeline dönüştürmenin akıllıca bir yolu var gibi görünüyor,” diyor Zeiler. “Ve şu ana kadar, önceden eğitilmiş bir modeli bir akıl yürütme modeline dönüştürmek için gereken prosedür pek bilinmiyordu, kamuya açık değildi.”
R1’i farklı kılan şey, DeepSeek’in bunu nasıl yaptığını açıklamasıydı. “Ve görünen o ki süreç o kadar da pahalı değil,” diyor Zeiler. “Zor olan, ilk etapta o önceden eğitilmiş modeli elde etmek.” Karpathy’nin geçen yıl Microsoft Build etkinliğinde ortaya koyduğu gibi, bir modeli önceden eğitmek işin %99’u ve maliyetin büyük kısmıdır.
Eğer akıl yürütme modelleri oluşturmak sanıldığı kadar zor değilse, bugüne kadar gördüklerimizden çok daha yetenekli ücretsiz modellerin hızla yayılmasını bekleyebiliriz. Bilgi artık kamuya açık olduğuna göre, Friedman küçük şirketler arasında daha fazla iş birliği olacağını ve büyük firmaların sahip olduğu avantajın azalacağını düşünüyor. “Bunun devrim niteliğinde bir an olabileceğini düşünüyorum,” diyor.






























Geri bildirim: Muhaberat Evirileri — özel sayfa | 🦋🤖 YERSİZ ŞEYLER