Gündeme dön

LLM'ler Nasıl Çalışır? Token'dan Tahmine Uzanan Sayı Makinesi

Techquickie, ChatGPT'nin insan benzeri akıcılığının ardındaki mekaniği dört parçada açıyor: token'lar, ağırlıklar, eğitim ve çıkarım — ve neden bu bir düşünme değil, trilyon kez bilenmiş bir tahmin makinesi olduğunu gösteriyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — XQNhCU17ipM
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Sohbet Neden İnsan Gibi Hissettiriyor

Techquickie'nin “How Do LLMs Work?” videosu, ChatGPT'ye sorulan bir sorunun neden bazen karşınızda gerçek bir insan varmış hissi verdiğini doğrudan sorarak açılıyor. Sunucu, modelin e-posta yazmaktan uçuş ayarlamaya ve hatta site açıklarını bulmaya kadar uzanan becerilerinin bir sayılar yığınıyla nasıl mümkün olduğunu merak ettiriyor. Bu merakı yanıtlamak için Red Hat'te kıdemli makine öğrenimi mühendisi Colin Kilty 'ye mikrofon uzatılıyor ve ilk yanıt şaşırtıcı biçimde dürüst: dil modelleri özünde bir kara kutu , bilgi girer bilgi çıkar, arada ne olduğu tam bilinmez. Video bu itiraftan sonra “peki hiç mi bir şey bilmiyoruz?” diye yokluyor ve cevabı katman katman açıyor; Tıpkı bir haritanın efsanesini öğrenmek gibi, önce dilin nasıl sayıya döndüğünü anlamak gerekiyor.

Dilin Matematiği: Token'lar ve Kavram Haritası

Video, token kavramını en sade haliyle kuruyor: kelimeler yaklaşık dört karakterlik parçalara bölünür ve her parça belirli bir sayı listesine dönüştürülür. Her token harita üzerinde bir noktaya karşılık gelir ve bu harita tüm kavramların sözlüğü gibidir; anlamca yakın token'lar birbirine yakın durur. Örnek olarak deniz ve gölü kodlayan token'ların kavramsal yakınlık yüzünden komşu konumlandığı anlatılıyor. Burada iki teknik terim gündelik dille açılıyor: vektör gömme (vector embedding — her token'ı sayısal koordinata yerleştirme) ve gizli uzay (latent space — tüm kavramların yaşadığı soyut harita) . Analoji basit: Tıpkı gerçek bir sözlükte yakın anlamlı kelimelerin aynı sayfada toplanması gibi, model de dili sayısal bir haritada tutar ve düşünme dediğimiz şey bu harita üzerinde matematik yapmaktan ibarettir.

Kavram haritasını işleyen sayısal hamur ise ağırlıklar (weights) . Video insan beynindeki nöron bağlantılarının güçlenip zayıflaması benzetmesini kuruyor ve yapay ağlarda bu bağ güçlerinin sayıya dökülmüş haline ağırlık dendiğini söylüyor. Kilty'nin ifadesiyle ağırlıklar, modele yedirilen tüm insan bilgisine dayalı olarak modelin bildiği şeyi temsil eder. Bu yığın, mesajınızı öğütüp yanıt üreten tüm matematiğin hammaddesi ve bir modeli diğerinden ayıran en büyük farklardan biri. Önemli nokta, ağırlıkların programlanmadığı, eğitimle yontulduğu; yani kimse dilbilgisi, alaycılık veya yapay zekâ karakterlerini tek tek kodlamadı, bunlar veride olduğu için ağırlıklar ayarlandıkça kendiliğinden belirdi.

Dev Bir Ezber Fabrikası: Eğitim

Eğitim, videoda “hızlandırılmış deneme-yanılma” diye özetleniyor ve mekanizma üç adımda anlatılıyor: 1) Geniş bir metin derleminden bir parça al ve sonraki kelimeyi gizle. 2) Modelin tahmin etmesine izin ver. 3) Yanlışsa sayıları küçük bir itmeyle doğru yanıta doğru kaydır. Bu döngü internetin büyük kısmı üzerinde trilyonlarca kez tekrarlanınca ortaya bir sonraki kelimeyi çok iyi tahmin eden makine çıkıyor. Video burada “Worth it” esprisini patlatıyor ama altındaki fikir ciddi: model mutlak doğruyu öğrenmez, okuduğu her şeyin anketinde en olası sıradaki kelimeyi öğrenir. Dilbilgisi ve ton bu yüzden ayrı modül değil, ayarlanan ağırlıkların yan ürünüdür.

Özet kısmı, çıkarım adını verdiği yanıt üretimini de aynı mantıkla bağlıyor: model mesajınızı sayılara çevirip ağırlık yığınından geçirerek en olası sonraki kelimeyi hesaplar. Soruya verilen yanıtta bu ilk kelime cevabın başlangıcıdır; sonra model, sorunuz + ürettiği ilk kelimeyi bir bütün olarak yeniden çalıştırır, tekrar ve tekrar, otoregresif (autoregressive — her adımda kendi çıktısını bir sonraki girdiye ekleyerek) biçimde yanıtı kelime kelime örer. Sonuç hesap makinesi gibi nesnel doğru değil, “Family Feud”daki gibi anket ne diyorsa odur; anket ise modelin okuduğu her şeydir. Ağırlıklar büyüyüp veri arttıkça tahminler keskinleşir, bu yüzden model “daha akıllı” görünür.

Neden Yanlışta Israr Ediyor

Madem tahmin bu kadar iyi, neden sık sık uyduruyor? Video halüsinasyon (hallucination — kasıtlı yalan değil, yanlış bağlamda yanlış next-token seçimi) tanımını tam burada kuruyor. Model uygun bağlamı yakalayamayıp yanlış kelimeyi seçince artık o kelime girdinin parçası olur ve yol kilitlenir. Benzetme çarpıcı: hatasını kabul etmekte zorlanan biriyle konuşmak gibi, makine de yanlış kelimeyi söyledikten sonra geri adım yerine o patikada ısrar eder, çünkü yanlış artık verinin içindedir. Bu mekanizma aynı zamanda neden itiraz edince hemen geri adım attığını da açıklar: siz ek girdi verince olasılıklar yeniden eğilir ve model doğru yörüngeye döner. Yani yalan niyet değil, olasılık hesabının kaymasıdır.

Burada muhakeme modelleri (reasoning models) sahneye çıkıyor. Bu modeller yanıt öncesi “düşünüyorum” mesajı gösterip bir süre kendi kendine konuşur. Video bunu sihirli bir akıl yürütme olarak değil, ek metin üretip doğru kelimelerin olasılığını artırma tekniği olarak çerçeveliyor. Zor problemlerde işe yarar çünkü model, asıl yanıttan önce kendine bağlam biriktirir. Ancak bunun gerçek muhakeme sayılıp sayılmayacağı hâlâ tartışmalı; sunucu “kim bilir?” tonunu koruyor ve araştırmacıların modelin içindeki sözde düşünceyi izlemeye çalıştığını ama araçların henüz ilkel kaldığını ekliyor.

Karanlık Madde: İçeriği Hâlâ Haritalıyoruz

Videonun en ayık kısmı, yorumlanabilirlik araştırmasına ayrılıyor. Kilty, bireysel katmanların rollerinden söz ederken dikkat katmanı (attention layer — hangi token'lara odaklanacağını seçen mekanizma) örneğini veriyor ama bütün tabloyu biliyoruz iddiasından uzak duruyor. Araştırmacılar modeli içeriden gözleyip hesapların nasıl aktığını izlemeye çalışıyor; fakat bir fikre karşılık tek ağırlık kümesi yok, tek nokta birden fazla kavram için ateşleyebiliyor. Örnek, görsel tanıma modelinde aynı noktanın kedi yüzü, araba önü ve kedi bacağı için birden tetiklenmesi (polysemantic / superposition). En büyük modellerde trilyonlarca ağırlık varken Anthropic ekibinin liderinin “haritalanmış kısım küçük bir azınlık, geri kalan karanlık madde ” benzetmesi videonun omurgasına oturuyor. Yani modelin makers'ları bile kendi eserini hâlâ haritalıyor.

Kapanış, iki uç arasında gidip gelen spekülatif bir notaya taşıyor. Bir yanda araştırmacıların, büyüyen modellerin aynı noktaya yakınsadığı ve Platon'un evrensel doğruluk / düşünce uzayı (thought space — var olabilecek her kavramın, keşfin, formülün ve fizik yasasının bulunduğu soyut uzay) fikrine göz kırptığı görüşü var; her geçmiş-gelecek buluşun orada zaten durduğu fikri. Diğer yanda çok daha mütevazı bir yorum: belki de hepsi abartılı otomatik tamamlama . Video özellikle “çok yüksek seviyede özet geçtik” uyarısını yapıp detaya inmek isteyenleri Lab ekibinin makalelerine ve evde model çalıştırmayı anlatan home lab videosuna yönlendirerek bitiyor. Mesaj net: temelleri anladık (token, ağırlık, eğitim, çıkarım) ama bütünü bir araya gelince ortaya çıkan şey hâlâ bir tahmin makinesi ve düşünme benzeri davranış, internetle beslenince kendiliğinden büyüdü.

Benim okumamda video, izleyiciye pratik bir pusula da bırakıyor: dil modellerine bir hesap makinesi gibi mutlak doğru sorulmaz, bir anket gibi olasılık sorulur. Token-haritası ve ağırlık yığını, modelin neden akıcı, neden bazen inatla yanlış ve neden ek bağlam verince düzeldiğini tek çerçevede açıklar. Bugün evde küçük bir modeli denemek bile bu dört parçayı elle görmeyi sağlar; büyük modellerin karanlık kalan kısmını ise araştırmacılar adım adım aydınlatıyor. Merak eden için bir sonraki adım, daha derine inen yazılar ve yerel denemeler — abartmadan, deneye sadık kalarak.

Görsel: nodesdaily AI
KavramÖz
Token & Harita4 karakterlik parçalar sayıya döner, yakın anlamlar komşudur
Ağırlık & EğitimBağ güçleri bilgiyi taşır, trilyon tahminle bileniyor
Çıkarım & HalüsinasyonKelime kelime döngü; yanlış token yolu kilitler

Videodaki anahtar anlar

  1. Açılış — sayılar neden insan gibi konuşuyor
  2. Kara kutu itirafı ve dikkat katmanı
  3. Token'lar ve kavram haritası
  4. Ağırlıklar ve eğitimde trilyon deneme
  5. Çıkarım döngüsü ve anket benzetmesi
  6. Halüsinasyon, muhakeme ve karanlık madde

AI yorumu

"Bence videonun en dürüst cümlesi en baştaki kara-kutu itirafı: Girdi girer, çıktı çıkar, aradaki hesap hâlâ büyük ölçüde karanlık. Bu belirsizliği kabul etmek, modelden mucize beklemek yerine doğru yerde güvenmeyi öğretiyor."

AI değerlendirmesi

Video, kara-kutu vurgusunu en güçlü haliyle kurduğu için değerli: Kilty'nin “girdi girer çıktı çıkar” cümlesi, modelin mutlak doğru makinesi olduğu yanılgısını baştan boşa çıkarıyor. Bu iskelet, ağırlıkların bilgi taşıyıcısı olduğu ve Family Feud anketi benzetmesiyle birleşince, dil modellerini deterministik hesap yerine olasılıksal tahmin olarak görmek kolaylaşıyor. En güçlü haliyle okunursa: model yalan söylemiyor, elindeki ankete göre en olası sıradaki kelimeyi seçiyor; bu çerçeve, halüsinasyonu niyetten değil bağlam eksikliğinden okumamızı sağlıyor. Güncel literatürde de muhakeme modellerinin kendi düşünce izini tam yansıtmayabildiği bulgusu (Anthropic, 2025) bu temkinli okumayı destekliyor.

Sınırlar da net: video süper-yüksek seviye özet olduğunu kendisi söylüyor ve Sponsor bloğu (MicroEnter) anlatının ortasını bölüyor, bu da bütünlüğü zayıflatıyor. Eğitim kısmında geri yayılım, optimizer, veri filtreleme ve hizalama (RLHF/RLAIF) gibi katmanlar atlanıyor; çıkarımda önbellekleme (KV-cache), örnekleme stratejileri ve güvenlik filtreleri konuşulmuyor. Ayrıca “tüm internet” ifadesi retorik; gerçekte lisans, kalite ve kesme tarihi filtrelerinden geçmiş bir alt küme kullanılıyor. Bu basitleştirmeler anlaşılırlık için faydalı ama üretimde maliyet ve risk hesabı yapan izleyici için eksik kalıyor.

Ne doğrulanabilir, ne iddia? Video bir ders değil, popüler bilim özetidir ve kaynak zinciri zayıf: tek uzman sesi (Red Hat), demo klipler ve atıf verilen Lab makaleleri. Superposition / polysemantic örneği ve Anthropic'in “karanlık madde” benzetmesi ise bağımsız kaynaklarda izlenebilir: Toy Models of Superposition ve Scaling Monosemanticity çalışmaları aynı fenomeni kontrollü oyuncak modeller ve Claude 3 Sonnet üzerinde gösteriyor. Plato'nun düşünce uzayı fikri ise felsefi spekülasyon, ampirik iddia değil; abartılı otomatik tamamlama karşı-ucuyla birlikte sunularak dengeleniyor. Yani olgusal çekirdek (token, ağırlık, eğitim, çıkarım) sağlam, felsefi varış noktası açık uçlu bırakılmış.

Pratikte kim için ne anlam taşıyor? Öğrenci veya meraklı izleyici için video, halüsinasyon = yol kilitlenmesi ve itiraz = yeni girdiyle olasılığı eğme gibi iki kalıcı mental model bırakıyor; bu modeller, modelle çalışırken bağlamı zenginleştirmenin ve düzeltmeyi net sormanın neden işe yaradığını açıklıyor. Ekipte ürün geliştirenler için çıkarım, muhakeme modellerinin zor problemde ek bağlam biriktirerek isabeti artırabildiği ama araçların hâlâ ilkel olduğu ; kritik kararlarda insan doğrulaması ve kaynak atfı şart. Kapanıştaki home lab yönlendirmesi de doğru yer: küçük bir modeli yerelde çalıştırıp tokenizasyon ve döngülü üretimi gözle görmek, soyut haritayı somut deneyime çeviriyor.

Kaynaklar

7 bağlantı; bunları kullanan başka yayımlanmış haber yok. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

llm · token · ağırlıklar · çıkarım · halüsinasyon · muhakeme

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…