Geoffrey Hinton'ın yapay zekanın vaftiz babası olarak anılması tesadüf değil; freeCodeCamp'in 27 saatlik bu uygulamalı kursu nedenini adım adım gösteriyor. Kurs, Hinton'ın onlarca yıla yayılan kilit makalelerini tek bir hatta diziyor ve her birini önce tarihsel bağlamıyla anlatıyor, sonra PyTorch'ta eğitim amaçlı, okunabilir bir kodla canlandırıyor. Eğitmen Mohammed Abrah, her bölümde motivasyonu, çözülmeye çalışılan problemi ve önerilen çekirdek fikri netleştirip görselleştirmeler ve küçük deneylerle destekliyor; amaç modern mimarilerin nereden geldiğini ezberle değil, yeniden üreterek kavramak.
Enerji ile öğrenme: Boltzmann makineleri ve Helmholtz fikri
Yolculuk 1980'lerde Boltzmann makineleriyle başlıyor. Ackley, Hinton ve Sejnowski'nin 1985'te formüle ettiği bu ağlar, öğrenmeyi istatistiksel mekanikten ödünç alınan enerji kavramıyla tanımlıyor: birimler olasılıksal olarak açılıp kapanıyor, ağırlıklar ise iki hipotezin birlikte doğru olma eğilimini kodluyor. Görünür ve gizli birimlerin ayrımı, yüksek dereceli kısıtları ikili etkileşimlere indirgeme fikrini getiriyor; gizli birimler, verideki düzenliliği açıklayan iç temsiller olarak ortaya çıkıyor. Yavaş olsa da bu çerçeve, bağlantı gücünü verinin olasılık dağılımını eşleştirecek şekilde ayarlama kuralını ilk kez matematiksel olarak berraklaştırdı.
Hemen ardından geri yayılımın modern yorumu beliriyor. Rumelhart, Hinton ve Williams'ın 1986'da çok katmanlı ağlara taşıdığı bu yöntem, kredi atama sorununa pratik bir çözüm sundu: hatayı zincir kuralıyla geriye doğru taşımak. Aynı dönemde dağıtık temsiller ve uzmanların uyarlanabilir karışımı gibi fikirler, bilginin tek bir yerde değil, birçok birimin ortak etkinliğinde kodlanması gerektiğini savundu. Bu bakış, sinir ağlarının ezberden çok genelleme yapabilmesinin kavramsal temelini attı ve sonraki on yılların mimari sezgilerini besledi.
1990'larda üretici modeller sahneye çıkıyor. Helmholtz makinesi ve wake-sleep algoritması, tanıma ve üretme ağırlıklarını iki ayrı fazda eğitmeyi önerdi: uyanıkken veriyi açıklayan gizli nedenleri kestir, uykudayken bu nedenlerden veri üret. Fikir, Boltzmann'ın iki denge durumunu andırıyor ama bu kez ileri beslemeli ağlarla yaklaşık çıkarım yaparak ölçeklenmeyi hedefliyordu. Başarı sınırlı kalsa da, değişkenler arasındaki belirsizliği modelleme ve çıkarımı öğrenme çabasının izleri, bugünkü varyasyonel yöntemlere kadar uzanıyor.
Görselleştirmeden derin inanca: t-SNE, derin inanç ağları ve ReLU
Yüksek boyutlu veriyi anlama ihtiyacı, stokastik komşu gömme fikrini doğurdu. Hinton ve Roweis'in SNE'si ve ardından van der Maaten ile Hinton'ın 2008'de geliştirdiği t-SNE, benzer noktaları düşük boyutta yakın tutan bir olasılık eşleştirmesi kurarak veri keşfini demokratikleştirdi. Bugün hâlâ araştırmacının ilk başvurduğu görselleştirme aracı olmasının nedeni, karmaşık manifoldları iki boyutta sezgisel kılması ve hataları gözle görülür hâle getirmesi.
2006, derin öğrenmenin inanç krizini aştığı yıl olarak anlatılıyor. Hinton ve öğrencilerinin derin inanç ağları için önerdiği açgözlü katman katman ön eğitim, kısıtlı Boltzmann makinelerini üst üste yığarak her katmanı ayrı ayrı eğitip sonra ince ayarla birleştiriyordu. Bu yaklaşım, etiketli veri azken bile derin ağların eğitilebileceğini gösterdi ve ReLU gibi doğrultulmuş doğrusal birimlerin RBM'leri iyileştirmesiyle birlikte derin Boltzmann makinelerine giden yolu açtı. Bir dönem rafa kalkan derinlik fikri, bu sayede yeniden ciddiye alındı.
Dönüm noktası 2012'de ImageNet ile geldi. Krizhevsky, Sutskever ve Hinton'ın AlexNet'i, iki GTX 580 üzerinde eğitilen 60 milyon parametreli, sekiz katmanlı bir evrişim ağı olarak yarışmada en yakın rakibini 10 puandan fazla geride bırakıp ilk 5 hata oranını yüzde 15,3'e çekti. ReLU aktivasyonu, dropout ve veri artırma birlikte çalışıyordu; grafik işlemcilerin hesaplama gücü ile büyük etiketli verinin buluşması, evrişimsel derin ağların ölçeklenebileceğini kanıtladı. O günden sonra görsel tanıma, derin ağların evine dönüştü.
Daha iyi genelleme: Dropout, damıtma, normalizasyon ve kapsüller
AlexNet'in bir diğer mirası, aşırı öğrenmeyi frenleyen dropout oldu. Srivastava ve Hinton'ın 2014'te sistemleştirdiği bu teknik, her eğitim adımında nöronların yaklaşık yarısını rastgele susturarak ağın tek bir özelliğe aşırı bağımlı kalmasını engelliyor; sanki her adımda farklı bir alt ağı eğitip ortalamasını almak gibi. Basitliğine rağmen genelleme hatasını belirgin biçimde düşürmesi, düzenlileştirmenin en pratik reçetelerinden biri hâline getirdi.
Bilgi aktarımını sadeleştiren iki fikir bunu izledi. 2015'te Hinton'ın damıtma çalışması, büyük ve hantal bir öğretmen ağının öğrendiği yumuşak olasılık dağılımını küçük bir öğrenci ağına aktarmayı önerdi; karanlık bilgi denen bu yumuşak etiketler, sınıf benzerliklerini de taşıyordu. 2016'da Ba ve Hinton'ın katman normalizasyonu ise mini yığın istatistiğine bağımlılığı kaldırıp her örnekte katman içi ortalama ve varyansı normalize ederek dizi modellerini ve küçük yığın eğitimini stabilize etti; özellikle dönüştürücü öncesi dönemde eğitim kararlılığını artırdı.
Kapsüller, nesne temsiline farklı bir sezgi getirdi. Sabour, Frosst ve Hinton'ın 2017'de önerdiği dinamik yönlendirme, bir kapsülün vektör çıktısıyla varlığın varlığını ve duruş parametrelerini birlikte kodlayıp alt seviye parçaların üst seviye bütüne anlaşarak bağlanmasını hedefledi; amaç bakış açısı değişiminde koordinat dönüşümünü matris çarpımıyla yapabilmekti. Hemen ardından pekiştirmeli görsel temsillerin karşılaştırmalı öğrenimi gibi akımlar, etiket olmadan da güçlü temsiller öğrenilebileceğini gösterdi.
Kursun son perdesi, geri yayılıma alternatif arayan Forward-Forward algoritmasına ayrılıyor. Hinton'ın 2022'de tanıttığı bu yöntem, ileri ve geri geçiş yerine iki ileri geçiş kullanıyor: gerçek veride her katmanın iyilik skorunu artırmayı, negatif veride düşürmeyi hedefleyen yerel amaçlar. Negatif veri ağın kendisi tarafından üretilebiliyor ve her katman kendi kaybıyla güncelleniyor; bu sayede türevleri saklamadan ve dondurmadan akış hâlinde öğrenme ve düşük güçlü analog donanımda çalışma ihtimali doğuyor. Yöntem henüz büyük ölçekte geri yayılımın yerini almıyor ama kortekste öğrenme için ilham verici bir model olarak tartışılıyor. Kurs, tüm bu başlıkları küçük deneyler ve görselleştirmelerle PyTorch'ta yeniden kurarak tarihsel fikrin bugünkü kodla nasıl buluştuğunu somutlaştırıyor.
AI yorumu
"Benim okumam şu: Bu kursu değerli kılan nostalji değil, her tarihsel fikrin bugünkü pratiğe nasıl sızdığını göstermesi. Boltzmann'daki enerji fikri, Dropout'taki düzenlileştirme sezgisi ya da kapsüllerdeki bakış açısı değişmezliği, bugün hâlâ mimari kararlarımızın altında duruyor; PyTorch ile yeniden yazmak bu sürekliliği görünür kılıyor."
AI değerlendirmesi
En güçlü karşı argüman şöyle: Tarihi kronoloji, modern başarıyı tek bir isme indirgeme riski taşır ve katkı ağını görünmez kılabilir; AlexNet'in verisi ImageNet'i kuran Fei-Fei Li ekibine, GPU altyapısı CUDA'ya, veri artırma ve optimizasyon püf noktalarına da borçlu olduğu hatırlatılmalı. Bu okuma haklı bir pay taşır, çünkü derin öğrenme kolektif bir birikimdir; ancak kursun her makalede motivasyon, problem ve çekirdek fikri ayırarak anlatması, Hinton çizgisini kahramanlaştırmadan bir tasarım sürekliliği olarak okumaya yardım eder.
Sınırlar açısından, 27 saatlik anlatı PyTorch'taki eğitim amaçlı sadeleştirmelere yaslanıyor; ölçek, veri temizliği ve üretim sistemlerindeki mühendislik katmanı ders kapsamı dışında kalıyor. Video kaynağı tek kanal üzerinden ve 0 kelimelik döküm web senteziyle tamamlandığı için içerikteki bazı tarih ve rakamlar ikincil kaynaklarla doğrulanmalı; özellikle yıl, yazar ve hata oranları gibi detaylarda ders notu ile özgün makale karşılaştırması yapmak isabetli olur.
Anlatı çıkar çatışmasına kapalı değil: freeCodeCamp kurs formatı erişimi artırmayı hedefler ve Hinton'ın kendi kurumsal anlatısı Nobel sonrası görünürlüğü pekiştirir; dışarıdan bağımsız bir hakem değerlendirmesi dersin parçası değil. Bu, içeriği değersiz kılmaz ama izleyicinin kapsül ağlar veya Forward-Forward gibi daha spekülatif başlıklarda beklentiyi ayarlarken hakemli sonuçlar ile deneysel önerileri ayırt etmesini gerektirir.
Pratikte çıkarım net: Öğrenen biri için en verimli yol, tarihi fikirleri küçük ölçekte yeniden üretmek ve ardından bugünkü projeye taşımak. Boltzmann ile enerji tabanlı düşünmeyi, dropout ile düzenlileştirmeyi, damıtma ile model küçültmeyi ve katman normalizasyonu ile eğitim kararlılığını deneyerek öğrenmek, soyut kavramları kararlara dönüştürür; kapsül ve Forward-Forward bölümleri ise ilham ve sınırları birlikte görmek için iyi bir laboratuvar sunar.
Kaynaklar
8 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube.com YouTube — Derin Öğrenmenin Zaman Tüneli: Hinton'un Boltzmann'dan Forward-Forward
- @freecodecamp.org https://www.freecodecamp.org/news/hands-on-evolution-of-deep-learning-geoffrey-hinton-s-ai-legacy/
- @cs.toronto.edu https://www.cs.toronto.edu/~hinton/
- @doi.org https://doi.org/10.1207/s15516709cog0901_7
- @wikipedia.org https://en.wikipedia.org/wiki/AlexNet
- @cs.toronto.edu https://www.cs.toronto.edu/~hinton/absps/distillation.pdf
- @arxiv.org https://arxiv.org/abs/2212.13345
- @arxiv.org https://arxiv.org/abs/1607.06450
deri̇n öğrenme · hinton · pytorch · yapay zeka