🦋🤖 Robo-Spun by IBF 🦋🤖
📺🫥📡 Medium Other 📺🫥📡
Makine öğrenmesi dışındaki çoğu insanın aklında kalan hikâye, güven telkin eden bir vaatle başlar: yeterince örnek topla ve dünya kendi kendine konuşsun. Geç dönem Hadoop çağında ‘Big Data’ yalnızca bir tekniğin adı değildi; işletmelerin, araştırmacıların ve politika yapıcıların etrafında toplanabildiği bir sancak işlevi gördü. İddia baştan çıkarıcı ölçüde kavranabilirdi. Yeterli gözlemle korelasyon kuramın önüne geçer, ortalamalarda hatalar eriyip gittiği için performans yükselirdi. Dil modelleme bu katekizmi erken benimsedi; daha büyük corpus’ları ilerlemenin ana ekseni saydı ve model tasarımını bir lojistik problemi olarak kurguladı. Bu duyarlığın konferans sunumlarına ve ürün planlarına süzülüşünü seyredebilirdiniz: ilk sırada önemli olan, öğrenmenin tekil tuhaflıkları etkisiz kılacak ölçekte gerçekleşebilmesi için daha fazla metin, daha fazla tıklama, daha fazla iz eklemekti.
Skor tahtası değiştiğinde o güven sarsılmaya başladı. 2018’de ‘AI and Compute’ başlığı altında geniş dolaşıma giren bir analiz, dikkati veri miktarından eğitim koşularının power eğrilerine yeniden odakladı; manşet sonuçların tükettiği compute’un şaşırtıcı bir hızda ikiye katlandığını izliyordu (🔗). Etki, teknik olduğu kadar kültüreldi de. Big Data arzuyu token ve event istiflemesi etrafında toplarken, Big Compute onu accelerator sayıları ve training FLOPs etrafında topladı. Fonlama sohbetleri, araştırma yol haritaları ve yetkinlik üzerine gündelik retorik yeni bir güneşin yörüngesine girmeye başladı. Artık ciddiyet, compute grafiğinde görünür olmak demekti.
O düğme bir kez basılınca alan bunu normatif kılacak bir dil buldu. ‘Scaling laws’ programı, pretraining loss’unun model parametreleri, dataset boyutu ve compute’un bir fonksiyonu olarak öngörülebilir biçimde düştüğünü gösterdi; mimari ayrıntılar önemliydi ama geniş aralıklarda, doğru eğri boyunca daha fazla harcamak kadar önemli değillerdi (🔗). Bu, konuşmayı ham büyüklükten tahsise kaydırdı. Her boyutu körlemesine şişirmek yerine uygulayıcılar, belirli bir bütçe için parametre ve token karışımının compute-optimal olanını sormaya başladılar. 2022’de Chinchilla çalışması bu noktayı billurlaştırdı: birçok kilometre taşı modelin, boyutuna göre undertrained olduğunu; aynı compute altında daha iyi tradeoff’larla—daha az parametreyle daha çok veri—daha üstün sonuçlar elde edilebileceğini savundu (🔗). Eski ‘more is more’ sloganı, şu yönetsel soruyla yer değiştirdi: nasıl harcamalıyız.
Bundan sonra Big Compute bir mühendislik üslubuna olgunlaştı. Mixture-of-Experts tasarımları, token’ları yalnızca bir ‘experts’ altkümesine yönlendirerek token başına computation’ı kabaca sabit tutarken mevcut parametre sayısını dramatik biçimde artırdı; kapasiteyi yeknesak uygulanan bir miktar olmaktan çıkarıp harcanabilir ve nişan alınabilir bir şeye dönüştürdü (🔗). Bir zamanlar eğrilerin pürüzsüzlüğüne duyulan soyut güven olan ‘scaling’ retoriği, bir bütçe disiplini hâline geldi. Ekipler, training compute, serving compute ve verification compute üzerine, birbirine bağlı ama ayrı kalemler olarak konuşmaya başladılar. Veri önemsizleşmedi; tahsise tâbi oldu, hacmiyle değil, bir sonraki FLOPs dilimini gerekçelendirme ve yönlendirme kabiliyetiyle değerlendirildi.
Maliyetler ve çevresel baskılar arttıkça sarkaç tereddüt tarafına dönüyor gibi göründü; fakat kemer sıkma dönüşü compute’dan geri çekilmek değil, onu niyetle harcama talebiydi. Özenle küratörlüğü yapılmış instruction set’lere vurgu yapan çalışmalar, küçük ama yüksek kaliteli supervision’ın, ilave token alayları olmaksızın davranışı keskin biçimde şekillendirebildiğini gösterdi; kürasyonu, alanın birkaç yıl önce sandığından çok daha verimli şekilde yetkinliğe çevirdi (🔗). Paralel çabalar, ‘textbook-quality’ materyallerin—yoğun, didaktik ve temiz—oldukça kompakt modelleri beklenenden üstün kılabildiğini ortaya koydu; veri işini, web’in sunduğu her şeye hücum etmekten ziyade etkili bir sinyal tasarımı olarak yeniden çerçeveledi (🔗). Bu yeniden çerçevede veri, compute’u nişan almanın bir yolu oldu; sonsuza dek genişletilecek bir depo değil.
Büyük dil modelleri AI’ın baskın kamusal yüzü hâline geldiğinde, Big Data’dan Big Compute’a yayı çizgiyi tamamlayan bir başka kayma başladı. Eğitim, alana bütçelerle konuşmayı öğretmişse, çıkarım (inference) ona zamanla konuşmayı öğretiyordu. Yetkinliğin pretraining ve mimariyle sabitlendiğini varsaymak yerine araştırmacılar, ‘reasoning’i belirli bir input üzerinde az ya da çok compute harcama politikası olarak görmeye artan ölçüde yöneldiler. Buradaki gündelik pratik somut ve ölçülebilir. Sistemler sorun zor olduğunda dallanır, iddia tartışmalı olduğunda doğrular ve bir tahminden daha ucuza gelecekse haricî araçlara danışır. Bu, metafizik bir ‘düşünme’ye dönüş değil; bir zamanlama kararıdır. LLM ilerlemesinin hikâyesi, bir zamanlar giderek büyüyen dataset’lerin düz bir çizgisi olarak anlatılırken, şimdi daha iyi, bir bütçe güzergâhı olarak anlatılıyor: training FLOPs, context length ve test-time deliberation’ın görev ve istek başına nasıl paylaştırıldığı.
Kamusal retorik ve yönetişim bu teknik yeniden hizalanmaları doğal olarak izledi. Big Data çağı, politikaları mahremiyet, erişim ve rıza odağına iterken, Big Compute çağı hükümetleri compute governance’a itti—accelerator ve memory üzerindeki ihracat kontrolleri, ulusal training cluster’ları, proje yılı yerine GPU-year cinsinden tanımlanan hibe programları ve kaynak kullanımını okunur kılan raporlama gereklilikleri. Bir esas-imleyen değiştiğinde olan budur. Alanı ‘data’ organize ettiğinde kilit kurumlar toplama ve uyumu gözetiyordu. ‘Compute’ devraldığında kilit kurumlar tahsis ve erişimi gözetir. Pratikte bu, araştırmacıların eğitim koşularını ekonomistlerin bütçeleri yazdığı gibi yazdığı; start-up’ların yalnızca bir model değil, pretraining, fine-tuning, retrieval ve post-training evaluation arasında denge kuran bir compute stratejisi pazarladığı anlamına gelir.
Böyle kaymaların nasıl olup da kaçınılmazmış gibi göründüğüne dair kültürel mekanizmalar üzerine paralel bir konuşma da gelişti. Yararlı bir okuma, başlıkların ve sloganların, tertemiz yöntemlerden çok önce, koordinasyon araçları olarak iş gördüğüdür. ‘X is all you need’ gibi bir sancak kışkırtma olarak doğar, kısa sürede bir dünya görüşüne sertleşir ve nihayetinde maliyet ve rekabet kaygısı kabardığında bir basınç vanasına dönüşür. Yakın tarihli yorumlar bu yaşam döngüsünü olağanüstü bir açıklıkla izliyor. 7 Ekim tarihli bir yazı, bu belirli başlığın bir makale adından alan-çapında bir merceğe nasıl mutasyona uğradığını, birbirinden kopuk taktikleri her defasında yeniden müzakere etmeksizin uyumlu kılmanın bir yolu hâline geldiğini takip ediyor (🔗). Ertesi günkü makale, ‘less is more’un minimalist bir nükteden kemer sıkma hesabına nasıl terfi ettiğini; seyrek aktivasyon, pruning ve özenli kürasyonu, asetik bir poz kesmeden savunmanın açık bir yoluna dönüştüğünü gösteriyor (🔗). Aynı gün yayımlanan bir eş yazı ise ‘scaling is destiny’ ifadesini, ampirik çekirdeği her ne olursa olsun, bütçe kararlarını doğallaştıran bir söylem olarak okuyor—nihayetinde yönetsel seçimleri neredeyse yazgı gibi gösteriyor (🔗). Birlikte okunduğunda bu yazılar teknolojik doğruları inkâr etmiyor; kaynakların kıt, zaman çizelgelerinin dar olduğu yerde sloganların gördüğü toplumsal işi adlandırmakta ısrar ediyor.
Alana yeni okurlar için zaman çizelgesi yalın görünür. Önce dil modellemenin nicelikle serpildiği sezgisi geldi—belli bir noktaya kadar doğru ve akıl yürütmesi kolay. Sonra hem muhasebecilerin hem mühendislerin gözünde görünen darboğazın compute olduğu ve en güvenilir iyileşmelerin harcama üzerindeki power-law eğrilerini izlediği fark edildi. Ardından ilerlemenin biçiminin yalnızca ‘daha büyük’ değil ‘daha iyi tahsis edilmiş’ olduğu keşfedildi—aynı compute ile parametre ve token karışımını ayarlayarak daha fazlasını elde etmek ve örnek zorluğuna göre test-time’da yeniden tahsis ederek daha da fazlasını elde etmek mümkünmüş. Her faz boyunca topluluğu seferber eden sözcükler, topluluğun görebildiğini de değiştirir. Big Data çağında anlamlı farklar küçük ve büyük corpus’lar arasındaydı; Big Compute çağında anlamlı farklar ucuz ve pahalı örnekler, kısa ve uzun context’ler, sığ ve derin deliberation arasındadır.
Etik ve pratik sonuçlar doğrudan buradan gelir. Kıt olan compute olduğunda adalet, accelerator ve kuyruklara erişim sorusuna; şeffaflık, training ve serving ayak izlerini raporlamaya; güvenlik, statik test setleri yerine adaptif inference altında ayakta kalması gereken evaluation rejimlerine ayrılmaz biçimde bağlanır. Bu dünyada sorumlu bir araştırma makalesi, varsaydığı tahsis rejimini—kaç training FLOPs, ne kadar context-window bütçesi, kaç verification geçişi—basitçe belirtir ve sonra bu seçimleri alternatiflere karşı savunur. Sorumlu bir ürün, ters yönde benzerini yapar; operatörlerin ne zaman ekstra zamana değdiğine karar vermesini sağlayan düğmeleri görünür kılar. Bu, hype’ın dili değil. Planlamanın dilidir.
Mevcut mutabakatı doğal yasa gibi ele alma ayartısı hâlâ var. Bunu zorlu kazanılmış bir uzlaşı olarak görmek daha akıllıcadır. Uzlaşı şudur: ‘data’ ve ‘model’ ortadan kaybolmaz, fakat ‘compute’ adlı bir çekim merkezi etrafında dönerler. Veri kürasyonu her zamankinden önemli çünkü her compute biriminin değerini yükseltir; mimarî ilerlemeler her zamankinden önemli çünkü compute’un zor kısımlara ne denli elastik yönlendirilebileceğini belirler; evaluation her zamankinden önemli çünkü dashboard’lar bir sonraki bütçenin nereye gideceği üzerinde gerçek yetkeye sahiptir. Bu bakımdan alanın en önemli kavramsal dönüşü belki de en basit olanıdır. LLM’lerde ‘reasoning’ dediğimiz şey büyük ölçüde zor örneklerde daha fazla zaman harcama iradesidir; tek geçişin yeteceğini varsaymak yerine deliberation’ı tahsis etmektir. Bu tanımayla Big Data’dan Big Compute’a uzanan uzun yay, hem teknik hem kavranabilir bir şekle oturur. Bu sistemlerdeki ilerleme, dikkat, bellek ve saniyeleri nasıl paylaştırdığımızın hikâyesi hâline gelmiştir. Bu, biriktirmeden tahsise geçişin ve belki de gecikmeli olarak, yetkinliğin yalnızca modele eğitilmiş bir özellik değil, zamana serilmiş bir bütçe olduğunun keşfinin hikâyesidir.






























Geri bildirim: Medium Other 📺🫥📡 | 🦋🤖 YERSİZ ŞEYLER