‘Scaling is destiny’nin uzun yolculuğu, sezgiden el kitabına

🦋🤖 Robo-Spun by IBF 🦋🤖

📺🫥📡 Medium Other 📺🫥📡

(İngilizcesi ve Almancası)

Büyük dil modellerinden sanki yerleşik bir türmüş gibi söz edilmeden çok önce, Richard Sutton’ın kısa bir denemesi, yapay zekâ ilerlemesinin her zaman el yapımı bilgiden ziyade öğrenen sistemlere daha genel hesaplama yüklemekten geldiğini savunuyordu. 2019 tarihli bu not, ‘The Bitter Lesson’ başlığını taşıyordu; kısa, bildirici ve elden ele dolaşması kolaydı; ölçeklemeyi bir ispat olarak değil bir duruş olarak, bir sonraki neyin işe yarayacağını kimsenin bilmediği durumda nasıl davranılacağına dair bir yol olarak sunuyordu. Ölçeği kuşku manzarasında güvenli bir bahis gibi muamele ettiği için, kısa sürede yönteme sertleşecek bir ruh hâlinin tohumu oldu (🔗).

Eğri bir doktrine dönüştüğünde

Bu duruş, 2020 başında geniş biçimde atıf alan ilk matematiğini kazandı: ‘Scaling Laws for Neural Language Models’ çalışması, modellerin parametre, veri ve compute bakımından büyümesiyle eğitim kaybının düzgün üs kanunlu eğriler boyunca düştüğünü gösterdi. İddia, hem izin verici hem öngörücü hissettirdiği için dolaşıma girdi: eğer eğri düzenliyse, gelecek aynı şeyin daha fazlasıdır ve tek hata çok erken durmaktır. Bu makale, ölçeklemeyi icat ettiği için değil—mühendisler zaten batch boyutlarını, token sayılarını ve hızlandırıcıları zorluyordu—ölçeklemeyi bir yönetim nesnesi olarak okunur kıldığı için soy kütüğünde özel bir yere oturur. İçgüdüsel duyumu, toplantıda elde tutulabilecek bir grafiğe çevirdi (🔗).

Bundan sadece birkaç ay sonra ‘Language Models are Few-Shot Learners’, ‘daha’nın satın alabileceği ufku genişletti. GPT-3’ün in-context learning gösterimleri özenli bir sadelikle sunulmuştu, ancak okur üzerindeki etkisi tiyatraldi: yalnızca tek bir modeli çok daha büyük kılıp değerlendirmeyi sade tutarak, makale, özel triklere gerek kalmadan yeteneklerin gelebileceğini ima etti. Bu çerçevede, ölçekleme yalnızca bir bütçe seçimi değil; temsil öğrenimini ilerlemenin merkezi motoru, test prompt’unu ise ona açılan ince bir arayüz sayan bir dünya görüşüdür (🔗).

Maliyet baskısı ve tutumlu ölçeğin icadı

Her büyük efendi-imleyen kendi muhasebe birimiyle karşılaşır. İlk baskı noktası token başına compute idi ve LLM çağındaki ilk popüler tahliye supabı sparse activation oldu. Switch Transformer, toplam parametre sayılarının tırmanmasını sürdürürken her token için ödenen compute’u kabaca sabit tutarak, ‘daha büyük’ü ‘her adımda daha büyük’ten ziyade ‘yedekte daha büyük’ olarak yeniden çerçeveledi. Bu hamle, ölçeğin toplumsal anlamını değiştirdi: gözü kara bir tırmanış değil, kapasiteyi bankaya koyup routing gerektiğini söylediğinde yerelde harcamanın bir yolu. Başlık teknik olabilir, ama altmetin örgütseldir—ölçek, tutumlu görünmeyi öğrenerek hayatta kaldı (🔗).

İkinci ve daha derin baskı, birçok modelin fiilen boyutuna göre yetersiz eğitildiği şüphesiydi. Chinchilla sonuçları buna compute-optimal eğitim kurallarıyla cevap verdi: toplam compute’u sabit tutarsanız, birçok ekibin kullandığından daha iyi bir parametre–token dengesi vardır. Bu, ölçeklemeyi çözümü basit üslerle yazılabilecek bir bütçeleme problemine yeniden ifade etti. ‘Her ne pahasına olursa olsun daha fazla’ yerine, vecize ‘eğrinin en çok büküldüğü yere daha fazla’ oldu. Bu ince yeniden-merkezleme, sloganın seyahatinde kritiktir: yetkesini yitirmeden kehanetten aritmetiğe daraldı (🔗).

zizekanalysis.com’daki anlatı ve yolculuğu nasıl yeniden çerçevelediği

Ardışık iki yazı, bu söylemsel kaymayı genel okur için berraklaştırıyor. İlki, ‘X is all you need’ gibi bir başlığın nasıl kavgaya kışkırtıp sonra onu affettiğini soruyor; bir yöntemi bir dünya görüşüne ve tedirgin bir alan için bir basınç supabına dönüştürüyor (🔗). İkincisi, ‘less is more’un özdeyişten hesaplamaya nasıl göç ettiğini gösteriyor: dataset curation, quantization ve pruning, sparse experts ve sıkı instruction tuning gibi tüm bir pratik ailesi, topluluğa geri çekilme gibi değil maharet gibi hissedilen bir kesme dili verdi (🔗). Birlikte okunduğunda bu yazılar, ‘scaling is destiny’nin seçici davranarak çelişkiden nasıl sağ çıktığını yakalar: ölçeği terk etmedi; hangi ölçeğin, ne zaman ve kime göre önemli olduğunu belirledi.

Düzgün eğriler pürüzlü kenarlarla karşılaştığında

Modeller araştırmadan ürünlere yayıldıkça, ölçekleme yasalarının pürüzsüzlüğü görevlerin dokusuyla yüzleşti. Özgün yasalara getirilen uzatmalar, rejim değişimlerini, veri karışımı etkilerini, bağlam uzunluğu hususiyetlerini ve sparse ağlarda toplam ile aktif parametre arasındaki farkı kabul etti. Alanın dikkati long-context training’e, attention with linear biases gibi (kısa eğit uzun test et biçiminde tanıtılan bir yöntem) uzunluk genelleme hilelerine ve bu hilelerin hangi koşullarda tutulduğuna döndü. Her ayar, erken grafiklerin metafizik parıltısını aşındırdı ve yerini mühendislerin gerçekten yaşayabileceği yerel kurallara bıraktı (🔗).

Bir başka önemli düzeltme, ‘emergent abilities’ fikrini hedef aldı. Erken raporlar, modeller belirli boyutları aştıkça ani, nitel sıçramalar gösteriyor gibi görünüyordu; sonraki analizler ise puanlama seçimlerinin ve eşikli metriklerin hayalet uçurumlar üretebileceğini gösterdi. Çürütme, ölçeklemeyi yaralamadı; onu evcilleştirdi. Ortaya çıkışı bir ölçüm artifaktı olarak yeniden tarif ederek, topluluk öngörülebilirlik vaadini korudu ve iddiaların ısısını düşürdü (🔗).

Kaderin yer değiştirmesi: eğitimde boyuttan çıkarımda zamana

Belki de son iki yılın en sonuçlu göçü, modeli ölçeklemekten müzakereyi/düşünmeyi ölçeklemeye kayış oldu. Training-time scaling sabit bir yeterlik rezervine yatırım ise, inference-time scaling daha zor prompt’lara daha fazla düşünce harcama kararıdır. Test-time compute’u açıkça inceleyen—branching, verifying, belirsizliğin yüksek olduğu yerlerde daha fazla adım tahsisi—çalışmalar, Sutton’ın denemesiyle aynı bahsi yeni birimle oynar. Düğme artık yalnızca parametreler veya pre-training token’ları değildir; soru başına ödenen zamandır. Mühendislik pratiği olarak bu, tek bedenin her duruma uymasını farz etmek yerine gecikme ile kaliteyi ayırmak gibi görünür. Söylem olarak, ‘kader’ anlatısının talihten ziyade tahsisten söz etmeyi öğrenmesidir (🔗).

Efendi-imleyenden bakım kılavuzuna

Bu noktada ‘scaling is destiny’ üç tür iş görmüş durumdadır. İlk olarak, bir kuşaklık büyük bahislere kalkan olmuş, kurumların araştırma yol haritalarını, donanım alımlarını ve benchmark kültürünü beklenen getiriler etrafında hizalamasını sağlamıştır. İkinci olarak, maliyetler diş gösterdiğinde compute-optimal kurallara ve sparse activation’a yol vererek ölçeğin hikâyesinin bütçelerin diliyle anlatılacağını kabullenmiştir. Üçüncü olarak, ürün kısıtları ve güvenlik endişeleri altında yana hareket etmeyi öğrenmiş, boyuttan zamana ve kaçınılmazlıktan yönetişime dönmüştür. Sayfada bu, durmadan alıntılanan ve yeniden okunan bir avuç başlık gibi görünür; pratikte ise panolar gibi: aktif parametre eğrileri, her routed expert’in gördüğü token’lar, belirli bir prompt sınıfında bir ek çıkarım adımının marjinal değeri.

Bugünün literatürünü kaybolmadan okumak için bilmesi gerekenler

Teknik makaleler, neyi sabitlemeye çalıştıklarını gördüğünüzde esrarlı değildir. Sutton’ın denemesi, yeterince compute ve doğru hedef verildiğinde, öğrenen sistemlerin el yapımı olanları geride bıraktığı içgüdüsünü sağlar (🔗). Özgün scaling-laws makalesi, iyileşmeler durduğunda eğitim rejimini genişletmeyi meşrulaştıran nicel iskeleti sağlar (🔗). GPT-3 raporu getirilerin görünür yüzünü verir; böylece ‘few-shot’ şaşırtıcı bir trik olmaktan çıkıp doğal bir beklentiye dönüşür (🔗). Sparse activation, mühendislerin kapasiteden her token’da ödeme yapmadan söz etmesine imkân tanır (🔗). Compute-optimal eğitim, birçok önceki modelin yalnızca pahalı değil kötü dengelenmiş olduğunu açıklar ve bir çare önerir (🔗). ALiBi çalışması, kullanmayı planladığınız en uzun bağlamlarda her zaman eğitim gerekmeyeceğini, uzunluk genellemenin nasıl mümkün olacağını açıklar (🔗). ‘Mirage’ tarzı emergence eleştirisi, ani sıçrama hikâyelerine neden kuşkuyla yaklaşmanız ve eşik-duyarlı dikkatli değerlendirmeyi tercih etmeniz gerektiğini gösterir (🔗). Son olarak, test-time compute üzerine araştırmalar ve raporlar, zamanı birinci sınıf bir bütçe olarak ele almayı öğretir; böylece bir sonraki ‘daha’ birimi, parametre sayacının bittiği yere değil, zorluğun en yüksek olduğu yere harcanabilir (🔗).

Söylemsel çekirdek: bir dünya görüşü bütçe yapmayı öğrenerek nasıl ayakta kalır

zizekanalysis.com’da zaten geliştirdiğiniz çözümleme, literatürün kendi başına dile getirmekten imtina ettiği genel bir noktayı görünür kılıyor: efendi-imleyenler teknik alanlarda gerçek iş görür. ‘X is all you need’ iddialı bir böbürlenme gibi ses verir ama bir koordinasyon aygıtı gibi çalışır; tereddüdü yeterince durdurarak bir pipeline kurmaya izin verir. ‘Less is more’ münzevi bir öğüt gibi ses verir ama bir training kuralı gibi çalışır; ekiplerin kısıtlar altında yapmak zorunda oldukları kesintiler için ahlâkî bir söz dağarcığı sağlar. ‘Scaling is destiny’nin sürmesi için her ikisine de ihtiyacı vardı. Başta, daha fazla token üzerinde daha büyük modeller eğitme cüretini meşrulaştırdı; sonra, enerji, gecikme ve fırsat maliyetleri biriktiğinde oranlar, rotalar ve adımlar dilini konuşmayı öğrendi. Bu dönüşüm projenin merkezini sapasağlam tutar. Mecazsız söylersek: imleyen bir bildiri olarak başladı ve bir hesap tablosu olarak bitti. Birincisinden ikincisine giden yol sinir kaybı değildir; bir araştırma kültürünün mühendislik kültürüne dönüşmesidir.

Hikâyenin bugünü

En yeni yay, test-time compute’u parametre sayısı ve pre-training token’larının yanına koyarak, eski ile yeniyi, aceminin anında kavrayabileceği bir biçimde birleştiriyor. Kalitenin yalnızca donmuş bir eserin özelliği değil, kullanım anında verdiğiniz bir karar olduğunu söylüyor. Bu, yalnızca boyutun nitel anahtarları çevireceğini umduğumuz erken, sarhoş edici evreden farklıdır. Aynı zamanda daha demokratiktir: iyi tasarlanıp iyi route edilen küçük ya da orta boy modeller bile, zor vakalarda zamana yatırım yaparak yetenek satın alabilir. Bu anlamda, ölçeklemenin ‘kader’i feshedilmedi; yerelleşti. Geleceği bir kerede ve herkes için söyleyen tek bir eğri yerine, her yerde küçük eğriler var—veri karışımlarında, aktif parametre sayımlarında, verifier derinliği ile hallucination arasındaki ilişkide, bağlam uzunluğu ile training tarifi arasındaki ilişkide—her biri bir sonraki ‘daha’ biriminin nereye gitmesi gerektiğini söylüyor. 2020’den beri literatürün başlıca katkısı, bu yerel yasaları keşfetmek ve geri kalanımızın okuyabileceği biçimlerde yayımlamak oldu.

Kapıyı açık tutan bir kapanış bakışı

zizekanalysis.com’daki başlık odaklı tarihler, bunun laboratuvarın ötesinde neden önemli olduğunu yakalıyor. İlk temaslarda güç gösterisi gibi görünen bir slogan, alan olgunlaştığında bir bakım kılavuzuna dönüşebiliyor. ‘Scaling is destiny’, neden çalıştığını kimsenin tam söyleyemediği bir zamanda inşa etmeyi sürdürmenin yolu olarak başladı; bugünse dikkati, belleği ve zamanı bütçelemenin yolu olarak sürüyor. Kanıt, tek bir makalede değil; söylemin metafizikten metoda soğumasında: power-law’lar satın alma planlarına, atılımlar kontrol listelerine, kaderler tahsislere dönüştü. Bu daha az romantik geliyorsa, daha dayanıklı da geliyor. O erken eğrilerin vaat ettiği gelecek kaybolmadı; makbuz tutmayı öğrendi.

1 Yorum

Filed under Suni muhaberat

One response to “‘Scaling is destiny’nin uzun yolculuğu, sezgiden el kitabına”

  1. Geri bildirim: Medium Other 📺🫥📡 | 🦋🤖 YERSİZ ŞEYLER