🦋🤖 Robo-Spun by IBF 🦋🤖
📺🫥📡 Medium Other 📺🫥📡
‘Less is more’ sloganı, 2018 sonrası “ölçek pek çok kırışıklığı kendiliğinden düzeltecek” inancına karşı geliştirilen karşı-ritim olarak LLM tartışmasına girdi. Nasıl yol aldığını anlamak için, laboratuvarlarda neler yaptığına geçmeden önce bu ifadenin söylemde ne yaptığından başlamak faydalıdır. Metin üzerinde ‘less is more’ kanıt değil, izin cümlesidir: seçenek-şişmesini durduran ve bir kısıtı—para, bellek, gecikme, etiket bütçeleri—yönteme dönüştüren yoğun bir araç. Žižekian Analysis, alanın başlık şablonlarını baskı altında dikkati sabitleyen ‘master-signifier’lar olarak okur ve ‘X is all you need’ tartışması bu hamleyi görünür kılar: yeterliliği ilan edersiniz ve kaosa rağmen çalışmak için zaman satın alırsınız (🔗). LLM çağında ‘less is more’, nihailik iddia etmeyen kardeş jest hâline geldi; dikkatli bir kesintinin—daha az etiket, daha az ince-ayar görmüş ağırlık, daha az aktif parametre, daha az bit, daha az örnek—bütçe başına daha çok yetkinlik verebileceğini, tabii kesinti doğru dikiş yerinden yapılırsa, ileri sürer. (🔗)
Bunun LLM hizalamasındaki ilk geniş paylaşılan ifadesi LIMA idi; 65B-parametreli bir modeli kasıtlı olarak yalnızca bin adet elenmiş prompt–cevap çiftiyle ve hiçbir reinforcement learning olmadan fine-tune etti. Makalenin temel iddiası, ufacık verinin sihirli biçimde bilgi yaratması değil, ön-eğitimin bunu zaten içerdiğidir; küçük ve temiz set biçimi, üslubu ve reddetmeyi öğretir. Ölçülen sonuç—insan değerlendiricilerin, çok daha pahalı kıyaslara karşı şaşırtıcı sıklıkla LIMA’nın çıktısını tercih etmesi—‘less is more’u romantizm değil işletimsellik gibi hissettirdi (🔗; PDF: 🔗). LIMA’dan taşınan şey bir tutumdu: ön-eğitimde ölçekle, hizalamada tasarrufla ilerle. (🔗)
Bu tutum bir kez edinilince, diğer ekipler ona farklı kaldıraçlar verdi. Microsoft’un Phi serisi etiketleri küçültmedi; kaosu küçülttü. ‘Textbooks Are All You Need’, ‘textbook-quality’ kaynaklarla—artı sentetik ders alıştırmalarıyla—eğitilmiş küçük modellerin, seçili açıklık sinyal-gürültü oranını ölçeğin tek başına garanti edemeyeceği biçimde artırdığı için, kodlama görevlerinde boyundan büyük iş çıkarabileceğini savundu. Mesaj somut: daha çok veri yerine daha iyi veriyi değiş tokuş ettiğinizde eğri, etki alanı ve model boyutunca belirlenen sınırlar içinde, yukarı kalkar (🔗; açıklayıcı: 🔗). Burada ‘less’, toplam token sayısının değil, dağınık token’ların azaltılmasının adıdır. (🔗)
Bir başka kol ‘less’i veri seti minimalizminden ziyade çalışma zamanı minimalizmi olarak ele aldı. Sparse activation fikri kelimenin tam anlamıyla bunu yaptı: Switch Transformer her token’ı bir veya iki uzman’a yönlendirir, token başı FLOPs’u neredeyse sabit tutarken toplam kapasiteyi büyütür. Bu, örnek başına daha az model kullanıp toplam manevra alanını artırmaktır ve kamu söyleminde parametre sayımlarını yeniden çerçeveledi: trilyon parametre, çoğu uykudaysa, verimlilik hamlesi olabilir (🔗; dergi sürümü: 🔗). Slogan burada bir veri vaadi değil, bir sistem vaadi olarak gezdi—daha az aktif compute ile daha çok yetenek. (🔗)
Sıkıştırma yolculuğu daha da ileri ve canlı kullanıma daha yakın itti. SparseGPT, GPT ölçeğinde ilk kez, bir modelin ağırlıklarının yarısını veya daha fazlasını tek atışta, perplexity’yi asgari bozarak, 100B sınıfı modellerde saatler içinde budayabileceğinizi gösterdi. Sonraki çerçeveler bit tarafında benzer iddialar kurdu: SqueezeLLM, post-training quantization’ı üç bite kadar zorlayıp yaygın kıyaslarda şaşırtıcı ölçüde iyi kaliteyi korudu. Her iki durumda da ‘less’, ürün ekiplerinin hissedebileceği bellek ve gecikme düğmesine dönüştü—daha kısa time-to-first-token, daha dar VRAM zarfı, daha yoğun multi-tenancy—model davranışı tanınabilir kalırken (🔗; OpenReview PDF: 🔗; SqueezeLLM makalesi: 🔗; repo: 🔗). Slogan’ın sıkıştırmadan geçerken izlediği patika, onu salt leaderboard’lara değil, panellere ve faturalara sabitledi. (🔗)
Yolculuğun çarpıcı ve daha geç bir durağı, ‘less’i akıl yürütme etrafında yeniden çerçeveledi. LIMO çalışması, yanıtları ezberletmek yerine süreç öğretmek üzere ‘bilişsel şablon’ gibi işleyen ufacık, cerrahi bir supervised örnek seti—yüzlerce, yüzbinler değil—oluşturdu ve zor matematik kıyaslarında büyük sıçramalarla alışılmadık OOD genelleme bildirdi. Her sayının ilerideki incelemelerden nasıl çıkacağı bir yana, kavramsal ihracat açıktır: ön-eğitim etki alanını zaten kodlamışsa, küçük ve iyi nişanlanmış örnekler, modelin bildiğini nasıl kullanacağını açan anahtarı çevirebilir (🔗). Bu, tasarruf değil pedagoji olarak ‘less is more’dur: daha az ders, daha çok transfer. (🔗)
Veri seçimi bu pedagojiyi rutine olgunlaştırdı. Anketler artık, tüm samanlığı değil doğru yönerge dilimini seçmeye yarayan teknikleri derliyor ve somut yöntemler, çeşitlilik, zorluk, güvenilirlik veya beklenen etki için seçilmiş bir veri setinin yüzde bir ila on ikilik kısmının, tüm veriyle yapılan fine-tune’u geride bırakabildiğini gösteriyor. Princeton LESS blog’u bu sezgiyi transfer bağlamları için erken çizdi; ICLR ve NeurIPS makaleleri o zamandan beri coverage-aware veya nearest-neighbor-aware seçimleri işletimselleştirdi ve bazen yüzde birde tüm-veri kıyaslarını geçti. Buradaki en açık ‘less is more’ sancağı, sentetik veri için adaptive coverage sampling’i resmileştirip, tüm sentetik havuzla eğitmekten daha iyi sınıflandırıcılar bildiren bir ICLR-25 çalışmasıdır. Sloganın bu duraktaki hikâyesi çilecilik değil, ölçümlemedir: ‘more’u, fazlalığı ölçerek, gürültüyü süzerek ve yetenek yüzeylerini dengeleyerek satın alırsınız. İlgili bağlantılar bu gelişmeleri ve programatik anketlerini açar (🔗; survey v2: 🔗; JAIR sürümü: 🔗; NAACL-24 self-guided selection: 🔗; NeurIPS-24 TSDS: 🔗; ICLR-25 coverage sayfası: 🔗; arXiv yansı: 🔗). (🔗)
Slogan dağıtım katmanlarına yayıldıkça, alan da sonuna bir soru işareti eklemeyi öğrendi. ‘Less’ kimin faydalandığını değiştirebilir. Adalet ve sıkıştırma üzerine ACL ve AAAI çalışmaları, pruning ve bazı quantization stratejilerinin, ortalama doğrulukla öngörülemeyen demografik yanlılık değişimlerine yol açabildiğini buluyor; başka işler kimi sıkıştırma biçimlerinin yanlılığı aşağı doğru düzenleyebildiğini, daha başkaları ise tutarsız ve modele bağımlı salınımlar gösterdiğini bildiriyor. NAACL-25, çıkarım hızlandırma tercihlerinin yanlılığı ve hatta yanıt uzunluğunu nasıl değiştirdiğini ayrıntılandırıyor. Bu ihtiyatlı güzergâhın pratik sonucu, ‘less’i, estetiğin sihirli eşanlamlısı değil, toplumsal etkilerini ölçmek zorunda olduğunuz sistem çapında bir müdahale olarak ele almaktır. Ortaya çıkan ‘fair quantization’ türü makaleler, grup-adaleti kısıtlarını yuvarlama hedefinin içine yerleştirerek aynı noktayı tasarım yoluyla vurgular. Bu sloganın olgunlaşmasıdır: ‘more’, yalnızca saniye başına daha çok token değil, daha çok eşitlik de içermelidir (🔗; AAAI-24 sürümü: 🔗; NAACL-25: 🔗; yanlılık-duyarlı quantization için arXiv önbaskı: 🔗; ilgili EMNLP-23 sıkıştırma analizi: 🔗). (🔗)
Bu epizotları birbirine bağlayınca, jargona yeniyseniz bile anlaşılır bir ana hat beliriyor. Her durumda ‘less’ daha az emek değil; daha isabetli bir kesintidir. Bin örneği kürate etmek, bir milyonu kazımaktan zordur; uzmanları dengede tutan bir router tasarlamak, yoğun katman yığmaktan zordur; sağlam üç bit quantization başarmak, her şeyi float’ta bırakmaktan zordur. Slogan, dış sınırlar bastırdığında mühendislere emeği nereye koyacaklarını söylediği için yaşar. Žižekian Analysis üzerinden okursanız, eylemi mümkün kılan asgari bir yasak gibi çalışır: belli türden ‘more’lara—daha gürültülü token’lara, daha yoğun compute’a, daha çok değerlendirici saatine—ket vurarak yolu açar ve alanı kapattığını iddia etmeden bunu yapar (🔗). (🔗)
Bu okuma, sloganın neden nesnesini sürekli değiştirdiğini de açıklar. Önce etiketler ve instruction-tuning yığınları için geçerliydi; çünkü maliyetlerle moda orada çarpışıyordu. Çıkarım bütçeleri baskın olduğunda, pruning ve quantization’a, sonra activation sparsity’ye taşındı. Akıl yürütme kıyasları statü diline dönüştüğünde, tekrar, olağanüstü küçük ve süreç öğreten veri setlerine kaydı. Sentetik veri depoları dolup taştığında ise coverage ve seçime yöneldi. Bu seyirlerin hiçbiri birbirini yadsımaz; hepsi, kuralı basit olan tek bir tasarruf hesaplamasının evreleridir: kütleyi yapıyla değiştir. Pratikte bu, generic web dökümlerinin yerine textbook-quality verinin, yekpare yoğun compute’un yerine sparse activation’ın, yığmanın yerine coverage-aware sampling’in, etiket halısının yerine birkaç yüksek kaldıraçlı gösterimin ikamesi olabilir (🔗; 🔗; 🔗; 🔗; 🔗). (🔗)
Bir öğreti değil bir hesap olduğu için, sloganın, aceminin de denetleyebileceği koşulları vardır. En iyi, ön-eğitimin hâlihazırda umursadığınız alanı kodladığı durumlarda çalışır; böylece az sayıda örnek içerik değil biçim ya da süreç öğretebilir. Kürasyon, yönlendirme veya ayrıklaştırma ile sinyal-gürültü oranını ölçülebilir biçimde yükseltebildiğinizde çalışır. Asıl darboğazınız benchmark puanları değil de bütçeler, gecikmeler veya yönetişim olduğunda çalışır. Bu koşullar yoksa ‘less’ görünüme çöker; üslup olarak minimalizme döner. Yazın bu sınırlar konusunda açıktır ve önyargı/sağlamlık bulguları ek bir koşulu dayatır: ‘more’u, aşağı akıştaki toplumsal etkileri de içine alacak kadar geniş tanımlayın ve test edin; çünkü VRAM’i düşüren aynı kesinti, denetlemezseniz, eşitsizlikleri yükseltebilir (🔗; 🔗). (🔗)
Bu açıdan bakıldığında ‘less is more’un seyahati bitmiş değildir. Bir sonraki duraklar bugünün konferans programlarında ve önbaskılarında görünüyor: çeşitlilik kısıtları altında bilgi kazanımını algoritmik olarak maksimize eden seçim yöntemleri, tek seferlik numaraları reçetelere dönüştüren anketler ve sentetik-veri üretimi ile seçimini iki ayrı zanaat yerine tek bir döngü olarak ele alan boru hatları (🔗; 🔗; 🔗; 🔗). Sabit kalacak olan, Žižekian Analysis’in ayıkladığı söylemsel işlevdir: hız, maliyet ve rekabet baskısı altında, basit bir ifade bir kısıtı yönlendirmeye çeviren emniyet supabı olabilir. LLM’lerde bu ifade, alana kütleden çok yapının kazandırdığını ve doğru kesintinin, doğru dikişten yapıldığında, bir büyüklük mertebesinden daha üretken olabileceğini hatırlattı. (🔗)
Bu hattın hemen güncel uzantısında, ‘Less is More: Recursive Reasoning with Tiny Networks’ gibi çalışmaların işaret ettiği yön belirginleşiyor: akıl yürütmeyi devasa parametre setlerine yaymak yerine, küçük ve dikkatle tasarlanmış ağlarda yinelemeli/recursive adımları disipline etmek, veri seçimi ve ipucu tasarımını (prompting) daha rafine hale getirmek ve hesap bütçesini doğruluk lehine yeniden dağıtmak. Bu çizgi, TinyStories ve benzeri yüksek SNR’lı eğitim kaynaklarından gelen derslerle birleştiğinde, ‘daha az’ın sadece sıkıştırma ya da etiket tasarrufu olmadığını, akıl yürütmenin organizasyonu olduğunu gösteriyor; küçük ağların doğru kurallar ve doğru örnekleme rejimleri altında uzun zincirli muhakemeyi kademeli olarak kurabildiği, böylece hem eğitim hem çıkarım tarafında daha öngörülebilir, daha denetlenebilir bir üretim pratiğinin mümkün olduğu görülüyor.






























Geri bildirim: Medium Other 📺🫥📡 | 🦋🤖 YERSİZ ŞEYLER
Geri bildirim: ‘Less is more’ in large language models: from a clever aside to an austerity calculus – Žižekian Analysis