Videonun açılışındaki hikâye tanıdık: GPT-1 küçük bir nokta gibiydi, bir yıl sonra GPT-2 gözle görünür büyüdü, ardından GPT-3, ChatGPT'nin ilk sürümüne güç veren dev, hepsini gölgede bıraktı. Performans da boyutla birlikte tırmandı ve sektör tek bir dersi ezberledi: daha büyük her zaman daha iyi, çok daha büyük ise çok daha iyi. Modeller öz-denetimli öğrenme ile eğitiliyor; bu yöntem etiket maliyetini neredeyse sıfıra indiriyor ve Wikipedia'nın tamamı, yüz binlerce kitap ile internetin filtrelenmiş büyük kısmını tek seferde yutmaya izin veriyor. Bu devasa okumadan sonra ortaya çıkan şey, kimse tek bir dilbilgisi kuralı öğretmediği hâlde her sözcüğün diğer sözcüklerle ilişkisini kodlayan dev bir matematiksel harita oluyor.
Genişlik neden yetmiyor: 50 bin kavram, birkaç bin boyut
İdeal bir modelde yaklaşık 50 bin sözcük ve kavramın her biri için geometrik uzayda tamamen bağımsız bir yön ayrılmış olurdu; bu sayı bile temkinli bir alt sınır. Gerçekte ise bu uzayın genişliği, araştırmacıların boyut dediği iç genişlik, genelde birkaç bin birimde kalıyor; GPT-3 ölçeğinde bile 12 bini biraz aşıyor. Eskiden kapasite dolunca modelin değersiz gördüklerini sessizce elediği düşünülürdü. 2022'de Anthropic'in oyuncak modelle gösterdiği tablo ise farklı: model kavramları elemek yerine aynı yönlere üst üste sıkıştırıyor. Buna süperpozisyon deniyor. Pratikte muz, fil, ranza, balon ve noktalı virgül gibi alakasız öğeler neredeyse aynı yöne düşebiliyor. Bu düzen, her kavramın cümle içinde aynı anda gerekmemesi sayesinde bir süre idare ediyor; tıpkı kalabalık bir dolapta her kıyafetin aynı anda giyilmemesi gibi.
Çakışma bedava değil. Model fil kavramını uyarmak istediğinde, aynı yöne sıkışmış diğer kavramlar da hafifçe ateşleniyor ve anlamlar birbirine bulaşıyor. Araştırmacılar bu bulaşmaya girişim adını veriyor. Girişim, bazen hafifçe kaymış bir sözcük seçimine, bazen de tamamen yanlış bir tahmine dönüşüyor. Yani hataların önemli bir kısmı kapasite eksikliğinden değil, yönlerin üst üste binmesinden kaynaklanıyor. Daha net görmek için mekanizmayı üç adımda düşünün: 1) kavramlar sınırlı boyuta sıkışır, 2) vektörler arası açı daralır, 3) eş-zamanlı aktivasyonlar karışır. Her adım, modelin sözcük haritasındaki gürültüyü biraz daha artırıyor.
Tek formül: genişlik iki kat, hata yarı yarıya
MIT ekibinin işaret ettiği formül sade: genişliği iki katına çıkarırsan girişim yarıya iner ve girişimden kaynaklanan hata da yarıya iner. Geniş bir matematiksel uzay, aynı kalabalık kavram kümesini daha seyrek yaymaya izin verdiği için büyük modeller daha iyi görünüyor. Sektör de tam bunu yaptı ve altı yıldır aynı kaldıracı çekiyor. Ancak yayma işlemi bir gün tamamlanıyor: her kavrama nihayet bağımsız bir yön verecek kadar alan açıldığında, üst üste binme kalmıyor, azaltacak girişim de kalmıyor. O noktadan sonra genişliği artırmak hiçbir şey satın almıyor; tavan bu.
Tavana varmadan bile üç fren devreye giriyor ve ilki para. Girişimi yarıya indirmek için genişliği ikiye katlamak gerekiyor, fakat her iki katlamada eğitim faturası en iyimser hesapla 6 kat artıyor. Bugün bir sınır modelinin maliyeti yaklaşık 300 milyon dolar kabul edilirse, bir katlama 1,8 milyar, ikincisi 11 milyar, üçüncüsü 65 milyar, dördüncüsü 390 milyar dolar ediyor; OpenAI veya Google için bile saçma bir skala. Diyelim ki enerji bedava oldu ve para sorunu buharlaştı; yine de hatanın düşüş hızı değişmiyor. Çünkü üs, insan dilinin istatistiğine kilitli. Zipf yasası diyor ki dilde çok az sözcük çok sık kullanılır ve, ise, o gibi parçacıklar, çok sayıda sözcük ise fotosentez veya kaleydoskop gibi nadiren görülür. Bu dengesiz dağılım, 1/bölü-genişlik üssünü sabitliyor ve daha hızlı iyileşmeye izin vermiyor.
Sıfıra inmeyen hata ve mutlak tavan
Üçüncü fren, dilin doğasından: dil 2 artı 2 eşittir 4 gibi tek cevaplı bir denklem değil. Günlük konuşmada Ben gerçekten severim dedikten sonra gelen sözcük kedi, köpek veya pizza olabilir; eğitim verisinde tek doğru yok. Bu belirsizlik indirgenemez ve toplam hatanın sıfıra extrapole edilmesini engelliyor. Araştırmacılar kaybı kabaca model boyutuna bağlı kısım artı sabit belirsizlik olarak yazıyor ve gerçek modellerin kaybını 1/bölü-genişlik doğrusuna yakın buluyor. Chinchilla ölçek yasalarıyla da uyumlu: parametre sayısı genişliğin yaklaşık 2,52 kuvvetiyle ölçeklendiği için parametreye göre üs 0,35 iken genişliğe göre üs 0,88-0,91 çıkıyor; yani 1'e yakın. Model ne kadar büyürse büyüsün, girişim kaynaklı kısım erise bile dilin içsel çok-anlamlılığı taban olarak kalıyor.
Tavanı somutlaştıran eşik, genişliğin kelime haznesindeki gerçekten bağımsız öğe sayısına yetişmesi. Kabaca 50 bin bağımsız yön gerekirken elimizde 12 bin varsa süperpozisyon yoğun. MIT/NeurIPS oyuncak deneylerinde zayıf süperpozisyon rejiminde kayıp yalnızca frekans dağılımı güç yasası ise güç yasası oluyor; güçlü süperpozisyon rejiminde ise kayıp geometrik çakışmadan doğuyor ve geniş dağılım ailesinde sağlam biçimde 1/bölü-genişlik izliyor. Açık kaynaklı modellerin son katman ağırlıklarının normalleştirilmiş satırları arasındaki ortalama kare çakışma 1/bölü-genişlik ile ölçekleniyor ve modeller güçlü rejimde çalışıyor. Bu yüzden genişlik sözcük haznesini yakaladığı gün, sistemin süperpozisyonu biter ve ek genişlik boşa gider. O güne kadar her iki katlama yarı yarıya iyileşme verse de, aynı yarı iyileşme için ödenen bedel katlanarak artıyor.
Metnin ötesi: dünyayı gören modeller
Peki ölçek duvarı aşılmazsa sırada ne var? Videonun son bölümünün işaret ettiği yanıt, metin dışı öğrenme: videodan ve duyulardan öğrenen dünya modelleri. Fikir, beynin öngörülü kodlamasına benziyor; gelecek kareyi tahmin etmek yerçekimi, akışkan dinamiği, katı cisim çarpışması gibi fizik sezgilerini öğrenmeye zorluyor. OpenAI'nin Sora'sı bunu görsel yamalara dönüştürerek yapıyor; büyük dil modellerinde metin jetonları neyse, Sora'da uzay-zaman yamaları o. Ne var ki Physics-IQ gibi 396 videoluk kontrollü testler, Sora, Runway, Pika, Lumiere ve VideoPoet gibi güncel video üreticilerinin fizik anlayışının görsel gerçekçilikten kopuk ve hâlâ zayıf olduğunu gösteriyor; en iyi skor 29,5 iken gerçek dünya değişkenliği 100. Sentez veriler fizik kurallarının gözetimle öğrenilebileceğine işaret etse de, izlemekle yetinmek nedenselliği öğretmiyor. Bu yüzden yeni öneriler, ağırlıkları birim küreye kısıtlayan nGPT gibi mimarilerle süperpozisyonu bilinçli teşvik edip küçük modelleri daha verimli kılmayı veya etkileşimli eğitimi tartışıyor.
AI yorumu
"Benim okumam şu: Yıllardır ezberlediğimiz ölçek mantra'sı artık matematikle çarpışıyor. Daha geniş her zaman daha iyi değil; geometri, dil istatistiği ve cüzdan aynı anda fren yapıyor. Gerçek sıçramayı metin üstünde daha çok genişlik değil, dünyayı gören modeller getirecek."
AI değerlendirmesi
Karşıt görüşü en güçlü haliyle kurayım: ölçeği savunanlar haksız değil. Chinchilla tarzı hesaplar, parametre, veri ve hesaplama arasında optimum denge olduğunu ve genişlik yanında veri ölçeğinin de hatayı düşürdüğünü gösteriyor. Yani tavan salt genişlikle tartışılamaz; daha akıllı veri seçimi, daha iyi optimizasyon ve mimari dokunuşlar aynı bütçede daha çok iş çıkarabilir. Bu çerçevede süperpozisyonu bilinçli teşvik eden nGPT gibi tasarımlar, aynı kayıpta daha küçük genişlikle benzer performansı hedefleyerek ölçek duvarını dolanma vaadi veriyor.
Sınırlar tarafında ise bu çalışmanın oyuncak modelden gerçek dil modeli başına uzanan köprüsü dikkat istiyor. Deneyler büyük ölçüde son katman projeksiyon matrisinin satırları üzerinden yürütülüyor; transformatör katmanlarının öğrendiği beceri, gramer ve akıl yürütme bu resme tam girmiyor. Değerlendirme kümesine ve model ailesine bağlı sabit belirsizlik terimi, hiçbir zaman sıfırlanamayan tabanı oluşturuyor ve hangi hatanın temsil kaynaklı, hangisinin modelleme kaynaklı olduğunu ayırmak zor. Ayrıca her modelin güçlü süperpozisyon rejiminde olduğu bulgusu, yeni mimarilerin rejimi değiştirebileceği ihtimalini dışlamıyor.
Doğrulanabilirlik açısından tablo sağlam ama dar. Makale NeurIPS'te yayımlanan Superposition Yields Robust Neural Scaling başlıklı çalışma ve kodu açık; ağırlık çakışmalarının 1/bölü-genişlik ile ölçeklendiği ölçümler tekrarlanabilir. Yine de büyük ölçekli iddialar için bağımsız laboratuvarların aynı genişlik aralığında farklı sözlük ve dillerde ölçüm yapması gerekiyor. Video anlatısı MIT etiketi taşıyor ve maliyet projeksiyonu 300 milyon dolar tabanıyla 4 katlamada 390 milyara varan elle hesap üzerinden kuruluyor; bu projeksiyon muhafazakâr 6 kat varsayımına dayanıyor ve enerji, donanım verimliliği veya algoritmik sıçramaları içermiyor.
Pratik çıkarım net: ölçekten mucize beklemeyi bırakıp beklentiyi ayarla. Girişimler için mesaj, daha geniş değil daha verimli model tasarlamak; küçük genişlikte süperpozisyonu iyi yöneten mimari ve eğitim rejimi, büyük modele göre maliyet avantajı yaratabilir. Kurumsal alıcı için tablo, sınır modeline yazılan her 6 kat bütçenin yalnızca yarı yarıya hata azalttığını ve dilin taban belirsizliğini silmediğini hatırlatıyor. Son kullanıcı içinse gelecek, metni daha kalınlaştırmakta değil, videoyu ve etkileşimi anlayan dünya modellerinde; kısa vadede en iyi yatırım, doğru dar model artı iyi veri hattı.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — MIT Ölçek Duvarı: Genişlik, Girişim ve Tavan
- @arxiv.org https://arxiv.org/html/2505.10465v4
- @neurips.cc https://proceedings.neurips.cc/paper_files/paper/2025/file/e97ac22927560eb2de6b658498cbc575-Paper-Conference.pdf
- @transformer-circuits.pub https://transformer-circuits.pub/2022/toy_model/index.html
- @arxiv.org https://arxiv.org/abs/2203.15556
- @openai.com https://openai.com/index/video-generation-models-as-world-simulators/
- @thecvf.com https://openaccess.thecvf.com/content/WACV2026/papers/Motamed_Do_Generative_Video_Models_Understand_Physical_Principles_WACV_2026_paper.pdf
llm olcek duwari · superpozisyon · zipf yasasi · girisim hatasi · dunya modelleri