Gündeme dön

Tek Kart Yetmez: Dev Dil Modelleri Yüzlerce GPU'da Nasıl Çalışıyor

Günümüzün en büyük yapay zeka modelleri tek bir GPU'ya sığmıyor; bu yazı, trilyon parametreli modellerin veri, boru hattı, tensör ve uzman paralelliğiyle yüzlerce kartta nasıl çalıştırıldığını ve ön doldurma ile kod çözme işlerinin neden ayrı havuzlara taşındığını anlatıyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — qZBibWYcKH4
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Bugünün en büyük yapay zeka modelleri bir trilyonun üzerinde parametre taşıyabiliyor ve bu ağırlıkları saklamak için 2 terabayta yakın bellek gerekiyor. Oysa piyasadaki en büyük GPU yaklaşık 288 GB bellek sunuyor; yani en iddialı kart bile bu dev modellerin yanına yaklaşamıyor. Peki her gün milyonlarca kişinin kullandığı sohbet robotları bu modelleri nasıl kesintisiz çalıştırıyor? Yanıt şaşırtıcı derecede yalın: bu modelleri barındıran tek bir dev bilgisayar yok. Onlar, birbirine bağlı onlarca, bazen yüzlerce GPU'dan oluşan eşgüdümlü bir sistemde koşuyor. IBM Technology kanalında Grace Ableidinger, bir LLM çıkarım işinin bu ölçekte nasıl ayakta tutulduğunu adım adım açıyor.

Üretimde bir modeli sunmak, aynı anda üç sınırı çözmek demek. Birincisi, modelin bellek izi: ağırlıkların tamamı, işe başlamadan önce bellekte yerini almalı. İkincisi, KV önbelleği denen çalışma belleği: model yanıt üretirken sohbet bağlamını bu alanda tutar ve üretilen her jetonla bu alan biraz daha büyür. Üçüncüsü, işlem hacmi: aynı anda yüzlerce, hatta binlerce kişi modele istek gönderdiğinde her istek kartta sıraya girer ve kuyruk uzadıkça herkesin bekleme süresi artar. KV önbelleği bu üçlünün en sinsi üyesidir, çünkü sabit durmaz, üretim sürdükçe şişer. Nvidia tarafındaki Dynamo çalışmasına göre bu şişen bağlam, GPU belleğinden alınıp CPU belleği ve hızlı disk gibi ucuz katmanlara taşınabiliyor; Vast ve WEKA doğrulamalarında tek bir H100 kartına saniyede 35 GB, sekiz karta 270 GB aktarım ölçülmüş.

Önce trafiği karşıla: veri paralelliği

Model ve önbelleği tek karta sığıyor ama kullanıcı sayısı başa çıkılamaz boyuta ulaştıysa en yalın çözüm, modelin tamamını birden çok karta kopyalamaktır. Veri paralelliği denen bu teknikte her kart, modelin birebir aynı kopyasını tutar ve gelen istekler kartların o anki yüküne, hatta hangi kartın ilgili bağlamı önbelleğinde hazır tuttuğuna bakılarak yönlendirilir. Kopyalar arasında eşgüdüm gerekmez; iş, her isteği doğru kapıdan içeri almaktan ibarettir. vLLM ekibinin 17 Şubat 2025 tarihli dağıtık çıkarım yazısına göre düşük bitli nicemleme yüz milyarlarca parametrenin ötesinde tek başına yetmiyor; bu yüzden çıkarım motoru tensör paralelliğini kart içinde, boru hattı paralelliğini kartlar arasında sunuyor. Yani trafik sorunu kopya sayısıyla, sığma sorunu bölme teknikleriyle çözülüyor.

Gerçekten büyük modellerde kopyalama yetmez, çünkü modelin kendisi tek karta sığmaz. Model aslında bilgi taşıyan transformatör katmanlarının art arda dizilmesidir ve çıkarım, girdiyi bu katmanlardan sırayla geçirmek demektir. Boru hattı paralelliği modeli katman gruplarına böler: ilk katmanlar birinci kartta, sonrakiler ikinci kartta durur. Tek bir istek gönderilirse kartların çoğu sırasını bekler ve atıl kalır; bu yüzden istekler montaj hattındaki gibi sürekli akıtılır, her istasyon dolu tutulur. Baseten mühendislik notlarına göre FP8 duyarlıkta bir milyar parametre yaklaşık bir GB bellek ister; 671 milyar parametreli DeepSeek-V3.1 tek bir B200 kartında bellek taşması verir, dört B200 kartındaki 720 GB ağırlıklara yetse bile KV önbelleğine yer kalmaz, çünkü önbellek çoğu zaman ağırlıklar dışında kalan alanın yüzde 80'ini alır. Sonuç: bu boyutta gerçek trafik için sekiz kartlık tam bir düğüm gerekir.

Modeli bölmenin iki yolu: boru hattı ve tensör

Modeli dikey kesmek yerine yatay kesmek de mümkündür. Tensör paralelliği katmanları değil, her katmanın kendi içindeki hesabı böler: her kart aynı katmanın bir dilimini alır, kendi payına düşen matematiği yapar, sonra kartlar parça sonuçları birleştirir. Bu birleştirme adımına toplu işlem denir ve her katmanda kartları bekleten bir eşiktir; yani kartlar hesabın ortasında sürekli haberleşmek zorundadır. Bu yoğun sohbet ancak yüksek bant genişlikli, düşük gecikmeli bir kart içi bağlantıyla yürür; bağlantı yavaşsa iletişim, kazandırdığından çok kaybettirir. DigitalOcean rehberine göre 70 milyar parametreli yoğun bir model BF16 duyarlıkta yalnız ağırlıklarıyla 140 GB ister; 4K bağlamda rahat sığan bir model, 64K ya da 128K bağlamda gerçek üretim trafiğinde karta sığmayabilir. Mesaj açık: bölme tekniği kadar, kartları birbirine bağlayan yolun hızı da sonucu belirler.

Bir de uzmanlar topluluğu gibi çalışan model türü var: uzmanlar karışımı. Bu modeller her girdide tek bir ağırlık bloğunu çalıştırmak yerine, yanıt üretiminin farklı yanlarında uzmanlaşmış küçük alt ağlar barındırır; biri yazılım örneklerine yatkındır, öteki noktalama işaretlerine, bir diğeri sayılara. Uzman paralelliği bu uzmanları kartlara dağıtır, böylece hiçbir kart modelin tamamını tutmaz. Her katmanda yönlendirici, her jetonu seçtiği birkaç uzmana yollar; güncel modeller 256 uzmandan 8'ini seçer, sonuçlar sonra birleştirilir. Jeton başına düşen hesap ciddi biçimde azalır, ama bedeli kartlar arası yoğun yönlendirme trafiğidir. Modular el kitabının vurguladığı gibi, veri paralelliğindeki her kopya kendi içinde tensör ya da boru hattı tekniğini kullanabilir; ayrıca yönlendirici, yanıt vermeyen kopyayı devreden çıkararak arıza sınırı sağlar.

İşin türüne göre havuz kur: ön doldurma ve kod çözme

LLM çıkarımının iki evresi kartları bambaşka yorar. Ön doldurma evresinde model girdiyi okuyup anlamlandırır; sabit ağırlıklar üzerinde yoğun paralel hesap yapar, hızı işlem gücü belirler ve bu sırada KV önbelleğini kurar. Kod çözme evresinde ise yanıt jeton jeton üretilir; her adımda büyümüş tüm önbellek bellekten çekilir, hızı bellek bant genişliği belirler. İki evre aynı havuzda durursa, kod çözmenin şişen bellek iştahı ön doldurmanın alanını daraltır. Çözüm, her evreyi kendi darboğazına göre ayarlanmış ayrı GPU havuzuna taşımaktır; ama bu hamle, önbelleğin iki havuz arasında ışık hızında taşınmasına bağlıdır. Sıradan TCP ve standart Ethernet bu hıza yetişemez; adanmış, düşük gecikmeli, RDMA destekli ağ gerekir. Amazon tarafının SageMaker HyperPod anlatısına göre ayrıştırılmış havuzlar EFA ve RDMA ile bağlanır; ilk jeton süresi ile jeton arası süre bağımsız ayarlanır, uzun girdiler süren üretimi tıkamaz. Ray kılavuzu da aynı ayrıştırmanın her evreyi bağımsız ölçekleyip farklı düğüm türlerinde daha ucuza çalıştırdığını belirtir; vLLM tarafındaki NIXL ve LMCache aktarma arka uçları bu taşımayı üstlenir.

Üretimdeki gerçek kurulumlar bu teknikleri üst üste uygular: sunucu içinde tensör paralelliği, sunucular arasında boru hattı, kopyalar arasında veri paralelliği, uzman karışımlarında uzman paralelliği ve evrelere göre havuz ayrımı. Buna çok boyutlu paralellik denir. Tüm bu yapının tepesinde bir orkestrasyon katmanı oturur; her isteği doğru GPU havuzuna yollar, yükü dengeler ve arızalanan kartın trafiğini düşürmeden devralır. Anlatıcının toparladığı gibi kural yalındır: trafik taştıysa kopya ekle, model sığmadıysa katman katman ya da dilim dilim böl, bellek iki ayrı iş yapıp şiştiyse her işe kendi havuzunu ver. Dağıtık çıkarım, devasa modelleri tek bir makineye sığdırma inadı değil, işi doğru parçalara ayırıp doğru kartlarda koşturma disiplinidir.

Görsel: nodesdaily AI
TeknikNe işe yarar
Veri paralelliğiModelin tam kopyaları trafiği paylaşır
Boru hattıKatman grupları kartlara bölünür
Tensör ve uzmanKatman içi dilim ve MoE yönlendirme

Videodaki anahtar anlar

  1. Üç darboğaz: bellek izi, önbellek, trafik
  2. Veri paralelliği ile trafik karşılama
  3. Boru hattı: katmanları kartlara bölme
  4. Tensör paralelliği: katman içini dilimleme
  5. Uzman paralelliği: 256 uzmandan 8'i
  6. Ön doldurma ve kod çözme havuzları
  7. Çok boyutlu paralellik ve orkestrasyon

AI yorumu

"Anlatıcı, dağıtık çıkarımı ders kitabı tanımlarıyla değil, üretimdeki gerçek darboğazlar üzerinden kuruyor; bu yaklaşım konuyu ezberden çıkarıp mühendislik kararına dönüştürüyor. Bence yazının en güçlü yanı, her tekniği tek bir soruya bağlaması: kart belleği mi doldu, trafik mi taştı, yoksa işin türü mü değişti?"

AI değerlendirmesi

Önce itirazı koyalım: her model bu mühendisliği hak etmez. Orta boy bir LLM, duyarlık düşürme ve tek ya da çift kartla rahatça sunulur; dağıtık kurulum ise iletişim yükü, gözetim maliyeti ve arıza yüzeyi ekler. Tensör paralelliğindeki katman başı toplu işlem, kartlar arası bağlantı zayıfsa hızlandırmak yerine yavaşlatır. Yani ölçeklendirme kararı, modelin boyuna ve trafiğin gerçek profiline bakılarak verilmeli; video bu eşiği sayıyla koymuyor.

Videoda tek bir ölçüm yok: ne gecikme süresi, ne saniyede jeton, ne de fatura rakamı geçiyor. Bu yüzden hangi tekniğin ne kadar kazandırdığı izleyicinin sezgisine kalıyor. Enerji tüketimi ve kart maliyeti hiç anılmıyor; oysa sekiz kartlık düğüm önerisi, bütçe satırı olmadan havada duruyor. Kuyruk taşması ve kart arızası gibi üretim dertleri de bir cümleyle geçiştiriliyor.

Anlatıcının çerçevesi öğretici ama tarafsız değil: IBM Technology kurumsal izleyiciye sesleniyor ve seçilen örnekler hep daha çok altyapı gerektiren tabloyu parlatıyor. Farklı çıkarım motorlarının karşılaştırması, herkese açık seçeneklerin artı eksi tablosu yok. Bu bir kusurdan çok türün doğası; yine de izleyici, anlatılanın bir ürün ekosisteminin diliyle kurulduğunu bilerek dinlemeli.

Okur için pratik sıra şöyle: önce hazır bir çıkarım motoruyla veri paralelliğini dene, ölç. Model karta sığmıyorsa boru hattı ya da tensör bölmesine geç; kartlar aynı sunucuda değilse boru hattını öncele. Uzun bağlamda önbellek taşıyorsa taşıma ve havuz ayrımını gündeme al. Hepsinden önce trafiği ölç; bölme, ölçülmemiş soruna bulunmuş pahalı yanıttır.

Kaynaklar

8 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

llm · dağıtık çıkarım · gpu · kv önbelleği · moe

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…