Gündeme dön

36 Trilyon İşlem: Ekran Kartının İçindeki Gizli Ordu

Branch Education, saniyede 36 trilyon işlemi kargo gemisi benzetmesi, GA102 hiyerarşisi ve bellek sayılarıyla adım adım açıyor. Oyun grafiğinden Bitcoin ve yapay zekaya uzanan paralellik mantığı sade bir dille birleşiyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — h9Z4oGN89MU
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Saniyede otuz altı trilyon işlem yapan bir kutu düşünün ve şaşkınlığınızı şimdiden hazırlayın. 1996 yılında Mario 64 yalnızca yüz milyon işlemle akıcı şekilde çalışıyordu ve bu değer bugün gülünç derecede küçük kalıyor. 2011 yılında Minecraft için yüz milyar işlem yeterliydi ve çıta bir anda bin kat yükseldi. Cyberpunk 2077 gibi modern oyunlar ise aynı ölçeği bir kez daha bin kat aşıyor. Bu gücü anlatmak için verilen benzetme çarpıcıdır: her saniye bir çarpma yapan insanlarla dolu tam 4400 Dünya gerekirdi.

Bu kartın kalbinde 10752 adet CUDA çekirdeği bulunurken masaüstü bir işlemcide yalnızca 24 çekirdek yer alıyor ve fark ilk bakışta inanılmaz görünüyor. Anlatımda bu fark kargo gemisi ile jumbo jet karşılaştırmasıyla açıklanıyor; biri devasa yükü yavaş taşıyor, diğeri küçük yükü çok hızlı ulaştırıyor. Üstelik esneklik tamamen işlemciden yana, çünkü grafik birimi işletim sistemi çalıştıramıyor ve ağ donanımlarıyla doğrudan konuşamıyor. Bu çekirdek ve bant genişliği rakamları Nvidia tarafından yayımlanan teknik belgelerdeki listelerle de genel olarak örtüşüyor.

Merkezdeki GA102 kalıbı 28,3 milyar transistör barındırıyor ve alanın büyük bölümünü işlem kümeleri kaplıyor. Kalıp önce 7 grafik işlem kümesine bölünüyor, her küme içinde 12 akış çoklu işlemcisi bulunuyor ve yapı aşağı doğru dallanıyor. Her warp içinde 32 CUDA çekirdeği ile bir tensör çekirdeği yer alıyor, toplamda 10752 CUDA, 336 tensör ve 84 ışın izleme çekirdeğine ulaşılıyor. Bu hiyerarşi ve çekirdek dağılımı TechPowerUp veri tabanındaki GA102 dökümlerinde de benzer biçimde aktarılıyor.

Kargo Gemisi mi Jumbo Jet mi

İlginç olan 3090Ti, 3090, 3080Ti ve 3080 modellerinin aynı GA102 tasarımını paylaşmasıdır ve fark üretimdeki şansla belirleniyor. Üretim sırasında toz veya desen hataları kalıbın küçük bir bölgesini bozabiliyor, mühendisler ise tüm kalıbı atmak yerine arızalı devreyi yalıtıyor. Kusursuz kalıplar 3090Ti olurken 3090 modelinde 10496, 3080Ti modelinde 10240 ve 3080 modelinde 8704 çekirdek çalışıyor. Ayrıca kartlar saat hızı, bellek miktarı ve bellek nesli gibi ayrıntılarla da birbirinden ayrışıyor.

Tek bir CUDA çekirdeği içine bakıldığında yaklaşık 410 bin transistörden oluşan küçük bir hesap makinesi görülüyor. En yoğun kullanılan bölüm A çarpı B artı C işlemini yapan eriyik çarpma toplama birimidir ve grafik yükünün bel kemiğini oluşturuyor. Çekirdeklerin bir kısmı 32 bit kayan sayı, diğerleri tam sayı veya kayan sayı ile çalışıyor, ayrıca işaret ve bit işlemleri için ayrılmış mantık bulunuyor. 10496 çekirdek 1,7 GHz hızla çarpıldığında saniyede 35,6 trilyon işlem rakamına ulaşılıyor ve hesap şaşırtıcı biçimde tutarlı duruyor.

Karta uzaktan bakıldığında baskılı devre, güç katları, soğutucu ve bellek yongaları bir bütün olarak çalışıyor. Voltaj regülatörü dışarıdan gelen 12 voltu yaklaşık 1,1 volta indiriyor ve yüzlerce watt gücü işlemciye sessizce taşıyor. Isı borulu dev soğutucu bu ısıyı kanatçıklara yayıp fanlarla dışarı atıyor, yoksa silikon dakikalar içinde sınırına dayanır. Oyunda 24 GB GDDR6X bellek sahneyi SSD üzerinden alıp tutuyor, 384 bit yol 1,15 TB/sn hız sunarken masaüstü bellek 64 GB/sn düzeyinde kalıyor. Bu bellek kapasitesi ve bant genişliği yaklaşımı Micron tarafından paylaşılan GDDR6X ürün notlarında da aynı yönde anlatılıyor.

Kusurlu Çipler Çöpe Gitmiyor

Veriyi bu hızda taşımak ikili 0 ve 1 düzenini tek başına yeterli kılmıyor, bu yüzden mühendisler voltaj basamaklarıyla oynamaya başlıyor. Eski GDDR6X dört seviyeli PAM-4 ile iki biti tek işarette taşırken yeni GDDR7 üçlü PAM-3 düzenine geçiyor. Üç bitlik gruplar iki üçlü sembole, uzun bloklar ise daha verimli paketlere dönüşüyor ve hat başına taşınan bilgi belirgin biçimde artıyor. Yapay zeka tarafında TSV bağlantılı HBM3E kümeleri üst üste dizilerek 192 GB kapasiteye ulaşıyor. Bu PAM ve üçlü kodlama ayrıntıları Wikipedia üzerindeki darbe genlik modülasyonu maddelerinde de sade biçimde özetleniyor.

Bellek Açlığı ve Sinyal Oyunları

Hesap tarafındaki sihir tek komut çok veri ilkesinde yatıyor ve sorun utanılacak kadar bölünebilir duruyor. Kovboy şapkası örneğinde yaklaşık 28 bin üçgen ve 14 bin tepe noktası model uzayında tanımlanıyor, her nokta kendi merkezine göre ölçülüyor. Sahne kurulurken her nesnenin konumu kendi köşelerine ekleniyor ve bağımsız model ölçüleri ortak dünya ölçüsüne çevriliyor. Söz konusu sahnede 5629 nesne, 8,3 milyon tepe ve 25 milyon toplama hesabı aynı kalıpla çözülüyor. Hesaplar birbirini beklemediği için binlerce çekirdek işi rahatça paylaşıyor ve sahne hızla kuruluyor.

Aynı Komut Milyonlarca Veriye

Bu esneklik donanımda iş parçacığı, warp, blok ve ızgara basamaklarıyla düzenleniyor ve her basamak ayrı bir ölçeği yönetiyor. 32 iş parçacığından oluşan warp aynı komut dizisini alıyor, bloklar akış çoklu işlemcilerine dağılıyor, ızgaralar tüm yongaya yayılıyor. Gigathread zamanlayıcı hangi bloğun nereye gideceğine karar veriyor ve trafiği akıllıca dengeliyor. Eski düzende warp kilit adımla yürürken yeni SIMT mimarisi her iş parçacığına ayrı sayaç veriyor, 128 KB paylaşımlı L1 ile dallanmaları yumuşatıyor. Bu kilit adımı ve dokuma tezgahı kökeni Cornell tarafından arşivlenen paralel programlama ders notlarında da benzer şekilde açıklanıyor.

Aynı paralellik oyun dışında da işe yarıyor ve iki uç örnek bunu açıkça gösteriyor. Bitcoin üretiminde SHA-256 özetleri rastgele nonce değerleriyle tekrar tekrar deneniyor, bu kart saniyede yaklaşık 95 milyon deneme üretiyor. Ne var ki 250 trilyon denemeye ulaşan özel ASIC kümeleri yanında ekran kartı kaşık gibi kalıyor ve devir çoktan değişmiş durumda. Tensör çekirdekleri ise üç matrisin çarpılıp toplanması işini üstleniyor, yapay zeka bu şablonu trilyonlarca kez yineliyor. Işın izleme çekirdekleri ayrı bir öykü olarak işaretleniyor ve meraklısı ilgili bölüme yönlendiriliyor.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. Açılış: 36 trilyon ölçeği
  2. Kargo gemisi benzetmesi
  3. GA102 ve çekirdek sayıları
  4. Binning ile kart ayrımı
  5. Bellek yolu ve sinyal
  6. SIMD ile şapka sahnesi

AI yorumu

"Anlatı ölçekten başlayıp silikona inen temiz bir merak çizgisi kuruyor ve sayılarla benzetmeleri dengeli kullanıyor. Binning ve sinyal kodlama bölümleri özellikle öğretici duruyor, sponsor geçişi ise tek cümlelik bir not gibi geçiyor. Bu yüzden yazı donanım merakı olan herkes için sağlam bir başlangıç sayılır."

AI değerlendirmesi

En güçlü karşı görüş, bu tablonun etkileyiciliğini teslim ederken sınırını da çiziyor: grafik işlemci genel amaçlı bir beyin değildir ve esneklik gerektiren her işte masaüstü işlemcinin gerisinde kalır. Enerji tarafı da unutulmamalı, çünkü yüzlerce watt güç ve dev soğutucular olmadan bu hız sürdürülemez. Bitcoin örneği bu sınırı somutluyor, çünkü özel ASIC kümeleri aynı işi binlerce kat verimli yapıyor ve ekran kartını madencilikte tarihe itiyor.

Eksikler de açık: ışın izleme çekirdekleri yalnızca işaret edilip geçiliyor, güç verimliliği için watt başına işlem gibi net bir oran verilmiyor. Bellek bölümlerinde Micron vurgusu yoğunlaşıyor, HBM ve GDDR övgüleri tanıtım tonuna yaklaşıyor. Bu eğilim bilgiyi yanlış yapmaz ama okurun sponsor dengesini akılda tutması gerekir.

Okur için çıkarım yine de değerli: paralellik fikri, bellek açlığı ve yonga sınıflandırma mantığı bir araya gelince modern hızın sırrı anlaşılıyor. Oyun için dev bellek yolları, yapay zeka için matris motorları ve madencilik için deneme bolluğu aynı ilkeden besleniyor. Bu yazıyı bitiren kişi, bir dahaki yükleme ekranında verinin SSD ile VRAM arasında nasıl taşındığını daha net hayal edebilecek.

Kaynaklar

6 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

ekran kartı · gpu mimarisi · cuda çekirdeği · gddr6x · yapay zeka · bitcoin madenciliği

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…