Gündeme dön

Sıkıştırma Zekâ mıdır? Entropiden Çapraz Entropiye Uzanan Bilgi Kuramı Yolculuğu

3Blue1Brown'un iki bölümlük serisi bilgi kuramının çekirdeğini sıkıştırma sorusu üzerinden yeniden kuruyor: metni kodlamanın temel sınırı nedir, yanlış olasılıklarla kodlama neye mal olur ve dil modellerinin eğitimindeki çapraz entropi kaybı neden logaritma olmak zorundadır? Birinci bölüm bilgiyi ve entropiyi, ikinci bölüm çapraz entropiyi, damıtmayı ve KL ıraksamasını ele alıyor; birlikte ele alındıklarında ön-eğitimi sonraki jetonu tahmin etme değil en iyi metin sıkıştırıcıyı inşa etme olarak okutuyorlar.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — GlYgs6v2YfU
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

İkili düzene çevrilen bir metni olabilecek en az veriyle taşımanın temel bir sınırı var mıdır? ASCII her harfe 8 bit ayırır; sık görülen harflere kısa kodlar vererek ortalamayı 4 bite indirmek mümkündür ve uzun metinlerdeki örüntülerden yararlanan daha akıllı yöntemler bunun da altına iner. Ama sınır nerededir? Soru 1940'lara, Claude Shannon'ın bilgi kuramını kuran çalışmasına uzanır; aynı matematik bugün dil modellerinin eğitiminde karşımıza çıkar.

Bugünkü dil modellerinde ön-eğitim sonraki jetonu tahmin etme ve çapraz entropi kaybı diye anlatılır; terimin kökü bilgi kuramındadır. Kuramın sonuçlarından biri tahmin ile sıkıştırmanın matematiksel olarak denk olmasıdır: iyi tahmin eden iyi sıkıştırır. Bu denklik ön-eğitim hedefini baştan okutur: mesele jeton tahmini değil, olabilecek en verimli metin sıkıştırıcıyı inşa etmektir.

Sıkıştırma zekâdır cümlesi iddialıdır ve zekâ gibi esnek bir kavrama yaslandığı için tek başına ölçülebilir bir iddia değildir; daha güvenli ifade, sıkıştırma matematiği ile yapay zekâ arasındaki bağın şaşırtıcı derinliğidir. Yine de kısa cümle düşünmeye kışkırtır; seri de bu kışkırtmayı ciddiye alıp üç videoda iddianın gerçekte ne anlama geldiğini yoklamayı amaçlar. İlk bölümün işi sınırları anlamak ve Shannon'ın gürültüsüz kodlama teoreminin çekirdek fikrini izleyiciye yeniden buldurmaktır.

Isınma örneği şudur: uzak bir uydudaki gezgin robota dört komut gönderilir, yukarı, aşağı, sol, sağ; her adım sabit boydadır. Komutlar eşit sıklıkta gelmez: iletilerin yarısı yukarı, dörtte biri aşağı, sekizde biri sol ve sekizde biri sağdır. Sadeleştirme için her komutun öncekilerden bağımsız biçimde aynı dağılımdan çekildiği varsayılır. Soru şudur: bit akışı pahalıysa bu komutları bite dökmenin en verimli yolu nedir?

Dosdoğru öğrenci her komuta iki bit verir ve kod çözme kolay olur, ama yukarı komutunun sıklığından hiç yararlanılmaz. Akıllı öğrenci değişken uzunluk önerir: yukarı 0, aşağı 10, sol 110, sağ 111. Ağırlıklı ortalama şöyle hesaplanır: yarı durumda 1 bit, dörtte bir durumda 2 bit, sekizde birer durumda 3 bit; toplam komut başına 1,75 bit. Sabit 2 bitlik düzene göre belirgin kazanç vardır.

Değişken uzunlukta kod çözme sorunu doğar: robot sınırları nereden bilecektir? Önerilen kodda hiçbir kod sözcüğü bir diğerinin başlangıcı değildir; bu özelliğe önek-dışı kod denir. Robot bitleri okur ve ancak tam bir kod sözcüğü oluştuğunda komutu kaydeder. Tüm ikili dizgelerin ağaç şemasında her seçim kullanılabilir kod uzayının bir payını tüketir: 0 yarı uzayı, 10 çeyreği, 110 ve 111 sekizerde biri kapatır. Paylar komut olasılıklarıyla birebir örtüşür ve boşluk kalmaz.

Kuramsal öğrenci gerçek kod yazmaz; ideal kodun taşıması gereken özellikleri düşünür. Fikri şudur: rastgele gürültü sıkıştırılamaz, öyleyse ideal sıkıştırmanın çıktısı rastgele gürültüden ayırt edilememelidir. n bitlik sıkıştırılmış ileti 2 üzeri n olasılıktan biridir ve gürültü görünümünde hepsi eşit olasılıklıdır; her kaynak iletinin olasılığı 2 üzeri eksi n olur. Bir iletiyi daha az bitle kodlamak ağaçta alt katmana indirmek demektir; kazanılan bir bit başka yerde iki bit kaybettirir, halıdaki tümsek gibi bastırılan yer başka yerden kabarır.

Bu akıl yürütme logaritmik ifadeyi kaçınılmaz kılar: ideal düzende n bit kullanan iletinin olasılığı 2 üzeri eksi n'dir; iki yanın 2 tabanında logaritması alınıp işaret değiştirilince bit sayısı ile eksi logaritma eşitlenir. Shannon bu büyüklüğü bir olayın bilgisi diye adlandırdı: olasılık sıfıra sıkıştıkça bilgi sütunu yükselir, olasılık yüzde yüze yaklaştıkça sütun kısalır. Olasılıklar 2'nin tam kuvveti olmadığında sonuç kesirli çıkar; kesirli bit, tek simgeye değil bütün iletinin kod uzunluğuna dair bir alt sınır olarak anlam kazanır.

Dil, robot örneğinden iki noktada ayrılır: her yeni harfin olasılığı kendinden önceki bütün bağlama sıkıca bağlıdır ve olasılıklar düzgün 2-kuvvetleri değildir. Videodaki küçük dil modeli demosu her konumda farklı bir dağılım üretir; modelin verdiği sayıların dilin gerçek olasılıkları sayılıp sayılamayacağı açık bir soru olarak kenarda tutulur. Bütün bir cümlenin olasılığı ardışık koşullu olasılıkların çarpımıdır; logaritma çarpımı toplama çevirdiği için bütün iletinin bilgisi simge bilgilerinin toplamına ayrışır. Üçüncü bölümde bu toplama yaklaşan gerçek bir sıkıştırma algoritması vadedilir.

Olasılıkları kestirmenin bir yolu kitapları tarayıp kısa harf öbeklerinden sonra ne geldiğinin çetelesini tutmaktır; ama hiç görülmemiş uzun bağlamlarda bu yöntem çöker. Shannon bunun yerine eşi Betty ile bir tahmin oyunu oynadı: kitaptan bir metni harf harf tahmin etmesini istedi, yanlışlarda doğru harfi yazdı, doğrularda çizgi çekti. Kısaltılmış metin aynı bilgiyi taşıyordu; çünkü Betty'nin kopyası tahmin oyunu tekrarlansaydı özgün metni geri üretebilirdi. 1950 tarihli makalede deney büyütüldü: her harf için kaç tahmin gerektiği kaydedilip bu sayı örtük bir olasılığa bağlandı.

Deneyin felsefi notu şudur: Shannon veriyi değil, dil bilen kara kutuları yokluyordu; insan beynini gelişmiş ama betimlenemez bir dil modeli gibi kullanıyordu. Bugün kara kutuları yoklamak yerine onları biz inşa ediyoruz. Entropi bu noktada tanımlanır: bir dağılımın simge başına ortalama bilgisi, yani her olasılığın bilgi değeriyle ağırlıklı toplamı. Adlandırma anekdotu von Neumann'a atfedilir ama videonun kendisi belgelendirmenin zayıf olduğunu not eder.

Sezgi şudur: dağılım ne kadar düzgün yayılırsa entropi o kadar yüksek, tek olay baskınlaşıp olasılık uzayını ele geçirirse o kadar düşüktür; simge sayısı arttıkça entropi büyür. Bu ifade Shannon'ın 1948 tarihli makalesindeki gürültüsüz kodlama teoreminin özüdür: hiçbir kod bu sınırdan verimli olamaz ve sınıra istenildiği kadar yaklaşılabilir. Bağlama bağımlı dil gibi süreçler için genelleşmiş sürüm simge başına ortalama bilgi üzerinden entropi hızını sorar. Shannon'ın en az 100 harf bağlam gören deneklerle vardığı tahmin, İngilizce için harf başına yaklaşık 1 bitti; yani dil, harf başına bir evet-hayır yanıtına sığacak kadar sıkıştırılabilir görünüyordu.

İkinci bölüm 2002 tarihli çarpıcı bir makaleyle açılır: Benedetto, Caglioti ve Loreto, Physical Review Letters'ta gzip ile diller arası yapıyı bulduklarını gösterdiler. Yöntem şudur: B belgesinden küçük bir parça A belgesinin sonuna eklenip sonuç sıkıştırılır ve bu, A'nın tek başına sıkıştırılmış boyuyla karşılaştırılır. Fark, B parçasının A'ya ayarlı sözlükle ne kadar iyi sıkıştığını söyler; diller benzerse küçük, farklıysa büyük çıkar. Bu birlikte-sıkıştırma uzaklığıyla dil tanıma, yazar atfı ve dil ailesi ağacının geri kazanıldığı rapor edilir.

Sonra sahne robot örneğine döner: uzay ajansı planı değiştirir, yeni dağılım yukarı ve aşağıda sekizde bir, solda dörtte bir, sağda yarı yarıya olur; kod çözücüler eski düzene çakılı kalmıştır. Yeni sıklıklarla eski kod uzunlukları çarpılıp toplanır: durumların sekizde birinde 1 bit, sekizde birinde 2 bit, dörtte üçünde 3 bit; ortalama komut başına 2,625 bit. Bu sayı eski dağılımın yenisine göre çapraz entropisidir ve sorduğu soru şudur: bir bağlama ayarlı kod başka bağlamda nasıl çalışır? Biçimsel tanım şudur: Q'ya ayarlı kod simgeye eksi log2(q_i) bit ayırır; gerçeklik P ise ortalama p_i çarpı eksi log2(q_i) toplamı olur. Çubuk şemada genişlikler P'yi, yükseklikler Q'nun bilgi değerlerini taşır.

İki sonuçlu oyuncak dağılımlarla sezgi pekişir: Q eşit, P eğri iken her simgenin bilgi değeri 1 bit olduğundan ağırlıklar sonucu değiştirmez, çapraz entropi 1 bittir. Roller değişince Q'nun entropisi 1 bitin altına düşer ama eşit dağılımlı gerçeklikte aynı kod yaklaşık 1,74 bit harcar; sıra önemlidir, çünkü formülde P ile Q farklı iş görür. P sabit tutulup Q değiştirilirse çapraz entropi eğrisi en küçük değerini Q=P noktasında alır ve bu en küçük değer P'nin entropisidir. Yeşil eğriyle çizilen bu iz, iki sonuçlu durumda P'nin entropi eğrisinin ta kendisidir.

Zip numarası bu mercekle yeniden okunur: A'ya ayarlı sıkıştırıcıyla B parçasını kodlamak, görgül bir çapraz entropi kestirimidir. Birebir çapraz entropi değildir: olasılık dağılımları değil belge örnekleri karşılaştırılır ve gzip Shannon sınırına oynayan ideal bir sıkıştırıcı olmaktan çok uzaktır; LZ77 tekrarları işaretçiyle değiştirir, Huffman kodlar. Yine de uzaklık ölçüsü olarak yazar tanıma gibi gerçek dil işlerinde işe yarar. Ders genelleşir: çapraz entropi, bir ortamın örüntülerinin başka ortamınkilerden ne kadar uzak olduğunu sayısallaştıran her yerde belirir.

Uygulama dil modellerinin eğitimidir: metin jetonlara bölünür, model her bağlamda sonraki jeton üzerine bir olasılık dağılımı üretir, kayıp bu dağılımın gerçek jetona verdiği olasılığın eksi logaritmalarının ortalamasıdır. Makine öğrenmesinde doğal logaritma kullanılır; 2 tabanından sabit bir çarpanla ayrılır ve öğrenme hızına gömülür. Neden logaritma? Benim adım boşluk kalıbı veride binlerce kez farklı isimlerle geçer; modelin Q dağılımı ile verideki P sıklıkları arasındaki toplam kayıp, F(Q) biçiminde genel bir fonksiyonla yazılır. Toplam kaybın yalnızca model veri dağılımıyla örtüştüğünde en küçük olması istenirse, Lagrange çarpanlı optimizasyon F'in türevini sabit-bölü-q biçimine zorlar; bu özelliği yalnızca logaritma taşır. El zordur: kayıp fonksiyonu seçim değil, koşulun dayattığı sonuçtur.

Yumuşak hedefli varyant damıtmadır: küçük model büyük modelin tek doğru jetonuna değil, aynı noktadaki bütün dağılımına bakarak eğitilir; çapraz entropi burada formülüyle açıkça yazılır. Benzetme satrançtır: sessizce oyun izlemekle güçlü oyuncunun her hamlede hangi seçenekleri ne ağırlıkla düşündüğünü anlatması arasındaki fark. Bölüm KL ıraksaması dipnotuyla kapanır: çapraz entropi eksi entropi, yani kötü ayarlı kodun simge başına boşa harcadığı bit; dağılımlar aynıysa sıfır, uzaklaştıkça büyür, asimetriktir. Üçüncü bölüme bırakılan söz, tahmin makinesini gerçek bir sıkıştırıcıya çeviren algoritma ve bu çevirinin ön-eğitimi en iyi sıkıştırma eğitimiyle eşitleyeceğidir.

Görsel: nodesdaily AI

AI yorumu

"Bu iki videoyu art arda izlemek bende şu izlenimi bıraktı: logaritma ezberlenecek bir kayıp tercihi değil, sıkıştırma sorusunu ciddiye alan herkesin varmak zorunda olduğu duraktır. Serinin yeniden keşif üslubu formülleri ezber listesinden çıkarıp akıl yürütmenin kaçınılmaz sonucu yapıyor; makaleyi de bu sırayla kurdum."

AI değerlendirmesi

Karşıt görüşü en güçlü haliyle kurarsam: sıkıştırma pasiftir, zekâ ise hedef, eylem ve ardışık karar gerektirir; kusursuz bir tahmin dağılımı bile tahminleriyle ne yapacağına karar vermez. Zip dosyası ajan değildir; bu itiraz Hutter'ın kendi zekâ tanımının karar-kuramsal direksiyonunu işaret eder. Sloganı bu haliyle savunmak zorunda kalsaydım, sıkıştırmanın dünya modeli motoru olduğunu, direksiyonun ise başka yerde aranması gerektiğini kabul ederdim.

Videonun değinmediği sınırlar da var: aktarılan deneylerde kodlayıcının kendi boyutu hesaba katılmaz; 70 milyar parametreli bir model metin dışı veriyi etkileyici oranlarda sıkıştırsa bile parametreleri karneye eklenince iki parçalı betimleme ham dosyadan katbekat büyük çıkar. Ezber-gerçek ayrımı da seride yoktur: modeller kapasiteleri dolana kadar ezberler, sonra genellemeye zorlanır; gzip ise Shannon sınırından fersah fersah uzaktır. Bu üç nokta, videonun verdiği sayıları okurken çerçeveyi tamamlar.

Kimin iddiası, kimin çıkarı sorusu burada da geçerlidir: bölümün sonundaki yetenek sayfası ve KL bulmacası içerikle organik bağlansa da ticari bir vitrindir. Chinchilla oranları ve eksi 0,95 ilinti gibi rakamlar ikincil aktarımlardır; karar anında DeepMind makalesinin deney düzeneği ve ilinti çalışmasının 31 model ile 12 benchmark kapsamı bağımsızca doğrulanmalıdır. Ben bu makalede sayıları dayanak değil, yön işareti olarak kullandım.

Benim çıkarımım şudur: kayıp eğrisi okuyan, damıtma kararı veren ya da bilgi kuramını sezgiyle öğrenmek isteyen biri için bu seri birinci sınıf bir duraktır; daha düşük kaybın otomatikman daha zeki model demek olduğunu sanan biri için ise tuzaktır. Kayıp vekil metriktir, kabiliyet belgesi değil. Sıkıştırma ile zekâ arasındaki bağı ciddiye alırım, ama aradaki eşittir işaretini her zaman kurşun kalemle yazarım.

Kaynaklar

12 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

entropi · çapraz entropi · sıkıştırma · bilgi kuramı · shannon · 3blue1brown · dil modelleri

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…