Modern dil modellerini kendi işime uyarlamak istediğimde karşıma çıkan ilk duvar parametre sayısı oldu: milyarlarca, hatta trilyonlarca ağırlığın tamamını yeniden eğitmek hem pahalı hem de çoğu ekip için pratik değil. Luis Serrano'nun videosu bu düğümü tek bir soruyla açıyor: devasa bir uzayda iğne aramak yerine, iğnenin büyük olasılıkla durduğu çok daha küçük bir samanlıkta arayamaz mıyız? Onun cevabı LoRA, yani düşük ranklı uyarlama: önceden eğitilmiş ağırlıkları dondurup her katmana eğitilebilir küçük çarpan matrisleri eklemek. Ben bu fikri ilk duyduğumda azın çoğu tutup tutmayacağından şüpheye düştüm; video beni adım adım ikna etti.
Serrano işe boyut kavramını sezgisel hale getirerek başlıyor: sıfır boyut bir nokta, tek boyut bir çizgi üzerinde ileri geri hareket, iki boyut bir düzlemde iki bağımsız yön, üç boyut ise bir hacmin içi. Bağımsız hareket yönü sayısı serbestlik derecesini veriyor ve makine öğrenmesinin çoğu binlerce, milyonlarca, dil modellerindeyse milyarlarca boyutlu uzaylarda geçiyor. Bu ölçekte her yöne bakmak kavramı anlamını yitiriyor; arama uzayı o kadar büyük ki akıllı bir kısıtlama lüks değil zorunluluk. Videonun orman benzetmesi tam burada devreye giriyor: iki boyutlu ormanda hazine aramak yerine, ormanı akıllıca kesen tek boyutlu bir ray döşersen daha az seçeneğin olur ama hazineye çok daha hızlı yaklaşırsın. Kısıtlama, doğru seçilirse kayıp değil kazançtır.
LoRA'nın çekirdek iddiası şu: yüksek boyutlu ağırlık uzayında amaçsızca dolaşmak yerine, uzayın içinden geçen ve uzayın önemli bir kısmını kapsayan iyi bir düşük boyutlu yol bul. O yol üzerinde yürümek çok daha ucuzdur ve yol akıllıca seçildiyse varış noktası ideal modele yeterince yakın olur. Üç boyutlu bir küpün içindeki hazineyi, küpü dilimleyen zekice bir yüzey üzerinde arayarak bulmaya çalışmak gibi. Burada kritik koşul güven: yöntem, başlangıç modelinin zaten iyi bir yerde durduğunu varsayıyor. Rastgele başlatılmış ağırlıklar üzerinde LoRA çalıştırmak, ormanın rastgele bir köşesine ray döşemeye benzer; oysa eğitimli bir modelin yanına döşenen ray, modelin bulduğu yüksekliğin çevresini tarar.
Fikri somutlaştırmak için video, iki cümlelik oyuncak bir veri kümesiyle eğitilmiş minik bir modele dönüyor: Mary dostça selam veriyor, Bob ise selamı yanıtsız bırakıyor. Modelin işi bir sonraki kelimeyi tahmin etmek ve 4 giriş, 2 gizli düğüm, 4 çıkıştan oluşan mimari bunu başarıyor. Ağın ilk yarısı bir anlayıcı gibi davranıp dört kelimeyi iki boyutlu bir gömme uzayına yerleştiriyor; ikinci yarısı ise bu gömmeden konuşma üretiyor. Eğitim sonunda kelimeler bir karenin köşelerine oturuyor: yatay eksen fiil ile kişiyi, dikey eksen dostça ile düşmanca olanı ayırıyor. Beni etkileyen detay şu: farklı rastgele başlangıçlarla eğitim tekrarlandığında kare dönüyor ama yapı bozulmuyor; model ısrarla aynı ilişkiyi keşfediyor.
İnce ayar aşamasında bu sekiz ağırlığı değiştirmek, dört köşe noktasını düzlemde serbestçe hareket ettirmekle aynı anlama geliyor. Her noktanın yatay ve dikey koordinatı bağımsız oynayabildiği için toplam sekiz serbestlik derecesi var ve bu sekiz sayı sinir ağındaki sekiz ağırlığa birebir karşılık geliyor. Yani modeli biraz iyileştirmek demek, sekiz boyutlu bir uzayda yeni bir konum aramak demek. Küçük bir oyuncak modelde bile arama uzayı sekiz boyutlu; milyar parametreli modellerde bu sayı astronomikleşiyor. Videonun bu noktada kurduğu denklem net: parametre sayısı eşittir arama uzayının boyutu. Maliyeti düşürmenin tek yolu boyutu düşürmek.
Boyutu düşürmenin en sade yolu kısıtlama koymak: bazı ağırlık güncellemelerini birbirine eşitlemeye zorla. Videodaki örnekte her noktaya ait iki güncelleme değeri eşitleniyor ve sekiz parametre dörde iniyor; noktalar artık düzlemde serbestçe değil, yalnızca 45 derecelik köşegenler üzerinde kayabiliyor. Hareket alanı daraldı ama aranacak yer de küçüldü; ideal model köşegenin üzerinde değilse tam isabet yok, fakat iyi bir yaklaşım var. Parametrelerin A, B, C, D gibi dört harfe indirgenmesi bu fikrin cebirsel karşılığı. Ödünleşim açık: tam özgürlükten vazgeç, hız ve ucuzluk kazan, hedefe yeterince yaklaşmayı umut et.
Köşegen tek seçenek değil; video aynı indirgeme fikrinin farklı kılıklarını da gösteriyor. İki köşegeni birden kullanmak, dikdörtgen ailesi içinde arama yapmak (yalnızca en ve boy olmak üzere iki parametre!) ya da noktaları bir çember üzerinde tutup her birinin açısını optimize etmek de aynı mantığın ürünü. Dikdörtgen örneği özellikle öğretici: karenin tam şekline güvenmiyorum ama dikdörtgenlik bilgisine güveniyorum, o yüzden tüm dikdörtgenler arasında en iyisini arıyorum. Her kısıtlama biçimi, modele duyulan güvenin farklı bir ifadesi: modelin keşfettiği yapıyı bozma, o yapının kombinasyonları arasında gezin. Matematik değişiyor, felsefe aynı kalıyor.
Köşegen fikri genelleştirilince işin içine eğim giriyor: yükselme ve yatay ilerleme olmak üzere iki yeni parametre ekleniyor ve toplam altı parametreye çıkılıyor. Fakat burada zarif bir fazlalık var; bir doğruyu tanımlamak için yükselme ve ilerlemenin ayrı ayrı değerleri değil, oranları yeterli. Tabanı 1 kabul edip eğimi tek bir M sayısına indirgemek mümkün ve parametre sayısı altıya değil beşe iniyor. Yatay ilerlemenin sıfır olduğu kenar durum matematikçiyi üzer ama makine öğrenmesinde binlerce parametre arasında bir değerin tam sıfır gelme olasılığı ihmal edilebilir düzeyde. Bu küçük muhasebe hilesi videonun en sevdiğim anlarından biri, çünkü LoRA'nın gerçek formülündeki benzer bir fazlalığın habercisi.
Videonun ortasından itibaren noktalar sahneden çekiliyor ve ünlü formül beliriyor: delta W eşittir A çarpı B. Serrano'nun okuması neredeyse şiirsel: delta W uzun bir hikâye anlatıyor, A ile B ise o hikâyenin özeti. Somut örnek 3x3'lük bir matris: satırları birbirinin katı olan bu matris dokuz sayı yerine çok daha az bilgiyle aktarılabiliyor. İki vektörün dış çarpımı aynı matrisi üretiyor ve dokuz boyutlu dünya altı boyuta iniyor. Mesaj berrak: bağımlılık barındıran büyük nesneler, küçük çarpanlarla özetlenebilir. Güncelleme matrisinin tamamını taşımak yerine özetini taşımak, LoRA'nın cebirsel kalbidir.
Buradan rank kavramına geçiliyor: bir matrisin rankı, içindeki bağımsız bilgi satırı sayısıdır. İlk satırın katlarından ibaret matris rank 1 taşır; her satırı farklı hikâye anlatan matris rank 3. Serrano'nun benzetmesi akılda kalıcı: elmanın fiyatını öğrendikten sonra iki elmanın fiyatını duymak yeni bilgi değildir, oysa muz ve karpuzun fiyatı ayrı satır ister. Rastgele matrisler neredeyse her zaman tam ranklıdır, yani şanslı bağımlılıklar barındırmaz; ama iyi haber şu ki her matris düşük ranklı bir matrise yaklaştırılabilir ve bu yaklaşımın en iyi yolu tekil değer ayrışımından geçer. Rankı düşük tutmak, bilgi kaybını kontrollü tutarak boyutu küçültmek demektir.
Rankın geometrik yüzü videonun en güçlü bölümü. Rank 2'li bir matrisin satırları düzlemde farklı yönlere bakan iki vektördür ve bu iki yönde (gerekirse ters yönde de) yürüyerek düzlemdeki her noktaya ulaşılabilir; matematikçiler ulaşılan bu kümeye gerilen uzay, yani kapsama der. Rank 1'li matriste ise iki vektör aynı doğruya yapışıktır ve ne yapılırsa yapılsın o doğrunun dışına çıkılamaz. Üç boyuta çıkınca tablo tamamlanıyor: üç bağımsız vektör hacim oluşturur (rank 3), biri diğer ikisinin toplamıysa tüm vektörler bir düzleme hapsolur (rank 2), hepsi aynı yönü gösteriyorsa geriye tek doğru kalır (rank 1). Rank ne kadar yüksekse gerilen uzayın boyutu o kadar büyük; LoRA ise güncellemeleri bilerek küçük bir uzaya hapsetmek.
Final perdesinde oyuncak örnek bırakılıp gerçek bir sinir ağı katmanına geçiliyor: solda 4, sağda 5 düğüm, yani 20 parametre. Bir gradyan inişi adımı, 4x5'lik bir güncelleme matrisi üretir ve LoRA bu matrisin 20 serbestlik derecesi taşıması gerekmediğini söyler: model zaten iyiyse güncellemeler arasında bağımlılıklar vardır. Matris, 4 elemanlı bir sütun vektörü ile 5 elemanlı bir satır vektörünün çarpımı olarak yazılınca 9 parametreye iniliyor. Üstelik eğim örneğindeki fazlalık burada da var: sütunu bir sayıyla çarpıp satırı aynı sayıya bölmek sonucu değiştirmiyor, o yüzden bir parametre daha düşüyor ve 8 kalıyor. Geometrik okuma etkileyici: 20 boyutlu uzaydaki hazineyi, içine özenle yerleştirilmiş 8 boyutlu bir odada aramak.
Genel formül tek satırda özetleniyor: m x n'lik bir matris, m x k ile k x n'lik iki matrisin çarpımıyla yaklaşık olarak ifade ediliyor ve k, m ile n'nin yanında küçük seçiliyor. Parametre sayısı m x n'den m x k artı n x k toplamına düşüyor; k küçüldükçe kazanç büyüyor. Orijinal makalenin sayıları iddianın ciddiyetini gösteriyor: GPT-3 175B ölçeğinde eğitilebilir parametre sayısı on bin kat azalırken bellek ihtiyacı üçte bire iniyor ve model kalitesi tam ince ayarla yarışıyor. Serrano'nun videosu bu tekniği formül ezberletmeden, geometrik sezgiyle öğretiyor ve bu yüzden türünün en iyi anlatımlarından biri. Benim defterime düşen cümle şu: iyi bir modelin yanında aramak, boş bir uzayda aramaktan her zaman ucuzdur.
AI yorumu
"Bu videoyu seçtim çünkü LoRA'yı ilk kez formülsüz, tamamen şekillerle anladığım anlatım bu oldu; bende bıraktığı his, pahalı bir ezberin yerini ucuz bir sezginin almasıydı."
AI değerlendirmesi
Videonun daha küçük uzayda arama yeterince iyi sonuç verir iddiasına en güçlü itiraz 2025'te hakemli literatürden geldi: NeurIPS'te yayımlanan bir çalışma, LoRA ile tam ince ayar arasındaki denkliğin bir yanılsama olabileceğini savunuyor; düşük ranklı güncellemelerin bazı görevlerde tam ince ayarın öğrendiğini öğrenemediğini gösteriyor. Bir başka çalışma da tabloyu iki yönlü çiziyor: LoRA daha az öğreniyor ama daha az unutuyor, yani önceden öğrenilmiş bilgiyi koruma konusunda cömert, yeni ve karmaşık davranış kazandırmada cimri. Bu mercekle videodaki hazineye yeterince yaklaşırsın vaadi her hazine için geçerli değil; hedef, başlangıç modelinin bildiğinden yeterince farklıysa küçük oda yetmiyor. En güçlü haliyle itiraz şu: LoRA bir kısayol değil, kapasite tavanı olan bir uzlaşmadır ve tavan görevden göreve değişir.
Video bilinçli bir seçimle pratik cephaneliği dışarıda bırakıyor: rank sayısının nasıl seçileceği, hangi katmanlara uygulanacağı, 8 bit kuantizasyonla birleştiren QLoRA ve yön-büyüklük ayrışımıyla LoRA'yı geçmeyi hedefleyen DoRA gibi varyantlar anlatıya girmiyor. Oysa 2024'te NVIDIA'nın duyurduğu DoRA, LoRA'yı birden çok görev ailesinde geride bıraktığını raporluyor ve kuantize modellerde QDoRA seçeneği sunuyor; yani hangi düşük ranklı yöntem sorusu 2021'de kapanmadı. Yöntem cephesinde de bir sınır var: videodaki tüm sayısal örnekler öğretici oyuncaklar, gerçek bir modelde ölçülmüş tek bir eğitim eğrisi yok. Anlatım sezgiyi inşa ediyor ama rank seçiminin bütçeye etkisini sayıyla göstermiyor.
Kaynak yapısı şeffaf: tek eğitimci anlatımı merkezde, sayısal dayanaklar ise orijinal LoRA makalesi (Hu ve arkadaşları, 2021) ve NVIDIA'nın DoRA duyurusu gibi yazılı kaynaklardan geliyor. Videodaki isim telaffuzları ve otomatik metindeki küçük bozulmalar taslak yazımında yazılı kaynaklarla çapraz kontrol edildi; rakam iddialarının tamamı makale özetine dayanıyor, ekran görüntüsüne değil. Bağımsız tekrar kontrol isteyecek nokta, eşdeğer kalite genellemesi: makale RoBERTa, DeBERTa, GPT-2 ve GPT-3 ölçümlerine dayanıyor, bugünün çok daha büyük ve farklı mimarili modellerinde tablo görev bazında değişebilir. Eğitimcinin kitap ve kurs duyurusu içeren kapanışı, anlatının bir içerik üreticisi ekonomisinin parçası olduğunu hatırlatıyor; bu, matematiği yanlışlamaz ama övgü dozunu okurken akılda tutulmalı.
Benim hükmüm şu: elinde tek ekran kartı olan bağımsız geliştirici ve küçük ekipler için LoRA hâlâ ilk durak; talimat takibi, üslup uyarlama, alan jargonu kazandırma gibi işlerde fiyat-performans dengesi rakipsiz. Buna karşılık modelin bilmediği yepyeni bir yetkinliği kazandırmak gerekiyorsa veya görev tam ince ayarla ölçülebilir fark üretiyorsa, düşük rank ısrarı pahalı bir inat olur; o noktada tam ince ayar ya da daha yüksek rank denenmeli. Videoyu izlemesi gereken kitle, formülden korkan ama sezgiyle öğrenen herkes; izledikten sonra yapılması gereken ise tek şey: küçük bir modelde rank 4, 8, 16 deneyip kendi görevinde tavanı bizzat ölçmek.
Kaynaklar
7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube Luis Serrano Academy — LoRA videosu
- @arxiv.org https://arxiv.org/abs/2106.09685
- @microsoft.com https://www.microsoft.com/en-us/research/publication/lora-low-rank-adaptation-of-large-language-models/
- @arxiv.org https://arxiv.org/html/2405.09673v2
- @papers.nips.cc https://papers.nips.cc/paper_files/paper/2025/file/ff541950d1e885af90f523571564a401-Paper-Conference.pdf
- @developer.nvidia.com https://developer.nvidia.com/blog/introducing-dora-a-high-performing-alternative-to-lora-for-fine-tuning/
- @github.com https://github.com/microsoft/LoRA/
lora · i̇nce ayar · rank · boyut i̇ndi̇rgeme · serrano