🦋🤖 Robo-Spun by IBF 🦋🤖
📺🫥📡 Medium Other 📺🫥📡
Büyük dil modellerinden sanki yerleşik bir türmüş gibi söz edilmeden çok önce, Richard Sutton’ın kısa bir denemesi, yapay zekâ ilerlemesinin her zaman el yapımı bilgiden ziyade öğrenen sistemlere daha genel hesaplama yüklemekten geldiğini savunuyordu. 2019 tarihli bu not, ‘The Bitter Lesson’ başlığını taşıyordu; kısa, bildirici ve elden ele dolaşması kolaydı; ölçeklemeyi bir ispat olarak değil bir duruş olarak, bir sonraki neyin işe yarayacağını kimsenin bilmediği durumda nasıl davranılacağına dair bir yol olarak sunuyordu. Ölçeği kuşku manzarasında güvenli bir bahis gibi muamele ettiği için, kısa sürede yönteme sertleşecek bir ruh hâlinin tohumu oldu (🔗).
Eğri bir doktrine dönüştüğünde
Bu duruş, 2020 başında geniş biçimde atıf alan ilk matematiğini kazandı: ‘Scaling Laws for Neural Language Models’ çalışması, modellerin parametre, veri ve compute bakımından büyümesiyle eğitim kaybının düzgün üs kanunlu eğriler boyunca düştüğünü gösterdi. İddia, hem izin verici hem öngörücü hissettirdiği için dolaşıma girdi: eğer eğri düzenliyse, gelecek aynı şeyin daha fazlasıdır ve tek hata çok erken durmaktır. Bu makale, ölçeklemeyi icat ettiği için değil—mühendisler zaten batch boyutlarını, token sayılarını ve hızlandırıcıları zorluyordu—ölçeklemeyi bir yönetim nesnesi olarak okunur kıldığı için soy kütüğünde özel bir yere oturur. İçgüdüsel duyumu, toplantıda elde tutulabilecek bir grafiğe çevirdi (🔗).
Bundan sadece birkaç ay sonra ‘Language Models are Few-Shot Learners’, ‘daha’nın satın alabileceği ufku genişletti. GPT-3’ün in-context learning gösterimleri özenli bir sadelikle sunulmuştu, ancak okur üzerindeki etkisi tiyatraldi: yalnızca tek bir modeli çok daha büyük kılıp değerlendirmeyi sade tutarak, makale, özel triklere gerek kalmadan yeteneklerin gelebileceğini ima etti. Bu çerçevede, ölçekleme yalnızca bir bütçe seçimi değil; temsil öğrenimini ilerlemenin merkezi motoru, test prompt’unu ise ona açılan ince bir arayüz sayan bir dünya görüşüdür (🔗).
Maliyet baskısı ve tutumlu ölçeğin icadı
Her büyük efendi-imleyen kendi muhasebe birimiyle karşılaşır. İlk baskı noktası token başına compute idi ve LLM çağındaki ilk popüler tahliye supabı sparse activation oldu. Switch Transformer, toplam parametre sayılarının tırmanmasını sürdürürken her token için ödenen compute’u kabaca sabit tutarak, ‘daha büyük’ü ‘her adımda daha büyük’ten ziyade ‘yedekte daha büyük’ olarak yeniden çerçeveledi. Bu hamle, ölçeğin toplumsal anlamını değiştirdi: gözü kara bir tırmanış değil, kapasiteyi bankaya koyup routing gerektiğini söylediğinde yerelde harcamanın bir yolu. Başlık teknik olabilir, ama altmetin örgütseldir—ölçek, tutumlu görünmeyi öğrenerek hayatta kaldı (🔗).
İkinci ve daha derin baskı, birçok modelin fiilen boyutuna göre yetersiz eğitildiği şüphesiydi. Chinchilla sonuçları buna compute-optimal eğitim kurallarıyla cevap verdi: toplam compute’u sabit tutarsanız, birçok ekibin kullandığından daha iyi bir parametre–token dengesi vardır. Bu, ölçeklemeyi çözümü basit üslerle yazılabilecek bir bütçeleme problemine yeniden ifade etti. ‘Her ne pahasına olursa olsun daha fazla’ yerine, vecize ‘eğrinin en çok büküldüğü yere daha fazla’ oldu. Bu ince yeniden-merkezleme, sloganın seyahatinde kritiktir: yetkesini yitirmeden kehanetten aritmetiğe daraldı (🔗).
zizekanalysis.com’daki anlatı ve yolculuğu nasıl yeniden çerçevelediği
Ardışık iki yazı, bu söylemsel kaymayı genel okur için berraklaştırıyor. İlki, ‘X is all you need’ gibi bir başlığın nasıl kavgaya kışkırtıp sonra onu affettiğini soruyor; bir yöntemi bir dünya görüşüne ve tedirgin bir alan için bir basınç supabına dönüştürüyor (🔗). İkincisi, ‘less is more’un özdeyişten hesaplamaya nasıl göç ettiğini gösteriyor: dataset curation, quantization ve pruning, sparse experts ve sıkı instruction tuning gibi tüm bir pratik ailesi, topluluğa geri çekilme gibi değil maharet gibi hissedilen bir kesme dili verdi (🔗). Birlikte okunduğunda bu yazılar, ‘scaling is destiny’nin seçici davranarak çelişkiden nasıl sağ çıktığını yakalar: ölçeği terk etmedi; hangi ölçeğin, ne zaman ve kime göre önemli olduğunu belirledi.
Düzgün eğriler pürüzlü kenarlarla karşılaştığında
Modeller araştırmadan ürünlere yayıldıkça, ölçekleme yasalarının pürüzsüzlüğü görevlerin dokusuyla yüzleşti. Özgün yasalara getirilen uzatmalar, rejim değişimlerini, veri karışımı etkilerini, bağlam uzunluğu hususiyetlerini ve sparse ağlarda toplam ile aktif parametre arasındaki farkı kabul etti. Alanın dikkati long-context training’e, attention with linear biases gibi (kısa eğit uzun test et biçiminde tanıtılan bir yöntem) uzunluk genelleme hilelerine ve bu hilelerin hangi koşullarda tutulduğuna döndü. Her ayar, erken grafiklerin metafizik parıltısını aşındırdı ve yerini mühendislerin gerçekten yaşayabileceği yerel kurallara bıraktı (🔗).
Bir başka önemli düzeltme, ‘emergent abilities’ fikrini hedef aldı. Erken raporlar, modeller belirli boyutları aştıkça ani, nitel sıçramalar gösteriyor gibi görünüyordu; sonraki analizler ise puanlama seçimlerinin ve eşikli metriklerin hayalet uçurumlar üretebileceğini gösterdi. Çürütme, ölçeklemeyi yaralamadı; onu evcilleştirdi. Ortaya çıkışı bir ölçüm artifaktı olarak yeniden tarif ederek, topluluk öngörülebilirlik vaadini korudu ve iddiaların ısısını düşürdü (🔗).
Kaderin yer değiştirmesi: eğitimde boyuttan çıkarımda zamana
Belki de son iki yılın en sonuçlu göçü, modeli ölçeklemekten müzakereyi/düşünmeyi ölçeklemeye kayış oldu. Training-time scaling sabit bir yeterlik rezervine yatırım ise, inference-time scaling daha zor prompt’lara daha fazla düşünce harcama kararıdır. Test-time compute’u açıkça inceleyen—branching, verifying, belirsizliğin yüksek olduğu yerlerde daha fazla adım tahsisi—çalışmalar, Sutton’ın denemesiyle aynı bahsi yeni birimle oynar. Düğme artık yalnızca parametreler veya pre-training token’ları değildir; soru başına ödenen zamandır. Mühendislik pratiği olarak bu, tek bedenin her duruma uymasını farz etmek yerine gecikme ile kaliteyi ayırmak gibi görünür. Söylem olarak, ‘kader’ anlatısının talihten ziyade tahsisten söz etmeyi öğrenmesidir (🔗).
Efendi-imleyenden bakım kılavuzuna
Bu noktada ‘scaling is destiny’ üç tür iş görmüş durumdadır. İlk olarak, bir kuşaklık büyük bahislere kalkan olmuş, kurumların araştırma yol haritalarını, donanım alımlarını ve benchmark kültürünü beklenen getiriler etrafında hizalamasını sağlamıştır. İkinci olarak, maliyetler diş gösterdiğinde compute-optimal kurallara ve sparse activation’a yol vererek ölçeğin hikâyesinin bütçelerin diliyle anlatılacağını kabullenmiştir. Üçüncü olarak, ürün kısıtları ve güvenlik endişeleri altında yana hareket etmeyi öğrenmiş, boyuttan zamana ve kaçınılmazlıktan yönetişime dönmüştür. Sayfada bu, durmadan alıntılanan ve yeniden okunan bir avuç başlık gibi görünür; pratikte ise panolar gibi: aktif parametre eğrileri, her routed expert’in gördüğü token’lar, belirli bir prompt sınıfında bir ek çıkarım adımının marjinal değeri.
Bugünün literatürünü kaybolmadan okumak için bilmesi gerekenler
Teknik makaleler, neyi sabitlemeye çalıştıklarını gördüğünüzde esrarlı değildir. Sutton’ın denemesi, yeterince compute ve doğru hedef verildiğinde, öğrenen sistemlerin el yapımı olanları geride bıraktığı içgüdüsünü sağlar (🔗). Özgün scaling-laws makalesi, iyileşmeler durduğunda eğitim rejimini genişletmeyi meşrulaştıran nicel iskeleti sağlar (🔗). GPT-3 raporu getirilerin görünür yüzünü verir; böylece ‘few-shot’ şaşırtıcı bir trik olmaktan çıkıp doğal bir beklentiye dönüşür (🔗). Sparse activation, mühendislerin kapasiteden her token’da ödeme yapmadan söz etmesine imkân tanır (🔗). Compute-optimal eğitim, birçok önceki modelin yalnızca pahalı değil kötü dengelenmiş olduğunu açıklar ve bir çare önerir (🔗). ALiBi çalışması, kullanmayı planladığınız en uzun bağlamlarda her zaman eğitim gerekmeyeceğini, uzunluk genellemenin nasıl mümkün olacağını açıklar (🔗). ‘Mirage’ tarzı emergence eleştirisi, ani sıçrama hikâyelerine neden kuşkuyla yaklaşmanız ve eşik-duyarlı dikkatli değerlendirmeyi tercih etmeniz gerektiğini gösterir (🔗). Son olarak, test-time compute üzerine araştırmalar ve raporlar, zamanı birinci sınıf bir bütçe olarak ele almayı öğretir; böylece bir sonraki ‘daha’ birimi, parametre sayacının bittiği yere değil, zorluğun en yüksek olduğu yere harcanabilir (🔗).
Söylemsel çekirdek: bir dünya görüşü bütçe yapmayı öğrenerek nasıl ayakta kalır
zizekanalysis.com’da zaten geliştirdiğiniz çözümleme, literatürün kendi başına dile getirmekten imtina ettiği genel bir noktayı görünür kılıyor: efendi-imleyenler teknik alanlarda gerçek iş görür. ‘X is all you need’ iddialı bir böbürlenme gibi ses verir ama bir koordinasyon aygıtı gibi çalışır; tereddüdü yeterince durdurarak bir pipeline kurmaya izin verir. ‘Less is more’ münzevi bir öğüt gibi ses verir ama bir training kuralı gibi çalışır; ekiplerin kısıtlar altında yapmak zorunda oldukları kesintiler için ahlâkî bir söz dağarcığı sağlar. ‘Scaling is destiny’nin sürmesi için her ikisine de ihtiyacı vardı. Başta, daha fazla token üzerinde daha büyük modeller eğitme cüretini meşrulaştırdı; sonra, enerji, gecikme ve fırsat maliyetleri biriktiğinde oranlar, rotalar ve adımlar dilini konuşmayı öğrendi. Bu dönüşüm projenin merkezini sapasağlam tutar. Mecazsız söylersek: imleyen bir bildiri olarak başladı ve bir hesap tablosu olarak bitti. Birincisinden ikincisine giden yol sinir kaybı değildir; bir araştırma kültürünün mühendislik kültürüne dönüşmesidir.
Hikâyenin bugünü
En yeni yay, test-time compute’u parametre sayısı ve pre-training token’larının yanına koyarak, eski ile yeniyi, aceminin anında kavrayabileceği bir biçimde birleştiriyor. Kalitenin yalnızca donmuş bir eserin özelliği değil, kullanım anında verdiğiniz bir karar olduğunu söylüyor. Bu, yalnızca boyutun nitel anahtarları çevireceğini umduğumuz erken, sarhoş edici evreden farklıdır. Aynı zamanda daha demokratiktir: iyi tasarlanıp iyi route edilen küçük ya da orta boy modeller bile, zor vakalarda zamana yatırım yaparak yetenek satın alabilir. Bu anlamda, ölçeklemenin ‘kader’i feshedilmedi; yerelleşti. Geleceği bir kerede ve herkes için söyleyen tek bir eğri yerine, her yerde küçük eğriler var—veri karışımlarında, aktif parametre sayımlarında, verifier derinliği ile hallucination arasındaki ilişkide, bağlam uzunluğu ile training tarifi arasındaki ilişkide—her biri bir sonraki ‘daha’ biriminin nereye gitmesi gerektiğini söylüyor. 2020’den beri literatürün başlıca katkısı, bu yerel yasaları keşfetmek ve geri kalanımızın okuyabileceği biçimlerde yayımlamak oldu.
Kapıyı açık tutan bir kapanış bakışı
zizekanalysis.com’daki başlık odaklı tarihler, bunun laboratuvarın ötesinde neden önemli olduğunu yakalıyor. İlk temaslarda güç gösterisi gibi görünen bir slogan, alan olgunlaştığında bir bakım kılavuzuna dönüşebiliyor. ‘Scaling is destiny’, neden çalıştığını kimsenin tam söyleyemediği bir zamanda inşa etmeyi sürdürmenin yolu olarak başladı; bugünse dikkati, belleği ve zamanı bütçelemenin yolu olarak sürüyor. Kanıt, tek bir makalede değil; söylemin metafizikten metoda soğumasında: power-law’lar satın alma planlarına, atılımlar kontrol listelerine, kaderler tahsislere dönüştü. Bu daha az romantik geliyorsa, daha dayanıklı da geliyor. O erken eğrilerin vaat ettiği gelecek kaybolmadı; makbuz tutmayı öğrendi.






























Geri bildirim: Medium Other 📺🫥📡 | 🦋🤖 YERSİZ ŞEYLER