Gündeme dön

Masaüstünde yapay zeka: Nemotron modellerini DGX Spark ve Station ile yerelde koşturmak

NVIDIA'nın Nemotron Labs bölümü, açık ağırlıklı Nemotron 3 modellerinin DGX Spark ve DGX Station üzerinde yerelde nasıl koşturulduğunu gösteriyor; resmi tarifler, donanım özellikleri ve ajan planı NemoClaw bu rehberde bir araya geliyor.

Nodesdaily’e aktarım: (UTC+03:00)
YouTube'da izle — WWp_RFBn34M
Okuma seçenekleri

Bu tarayıcıda cihazdan sesli okuma kullanılamıyor.

Kavram merceği

Bu görünümde geçen teknik kavramlardan birini seç. Genel tanımı, öğretici örneği ve haberdeki kullanımını birlikte oku.

Bu görünümde sözlüğümüzdeki kavramlardan biri bulunmadı. Sözlük henüz tüm terimleri kapsamıyor.

Bulut faturası olmadan akıl: Nemotron eve taşınıyor

NVIDIA Developer kanalındaki Nemotron Labs bölümü, çarpıcı bir iddiayla açılıyor: en yetenekli açık modellerden bazıları artık oturma odanızdaki bir kutuda koşabiliyor. Sunucu, Nemotron 3 ailesini merkeze alıp bu modellerin DGX Spark ve DGX Station üzerinde nasıl canlı bir servise dönüştüğünü adım adım gösteriyor. Build.nvidia.com adresindeki resmi playbook da aynı sözü veriyor: tek bir DGX Spark üzerinde, OpenAI uyumlu bir API arkasında üretim tarzı bir çıkarım sunucusu. Yani curl ile konuşabildiğiniz, ajanlara ve IDE araçlarına bağlayabildiğiniz gerçek bir uç nokta.

Önce ailenin kendisi. Research.nvidia.com adresindeki Nemotron 3 sayfasına göre aile 15 Aralık 2025 tarihinde duyuruldu ve üç üyeden oluşuyor: Nano, Super ve Ultra. Üçü de hibrit Mamba-Transformer MoE mimarisini paylaşıyor; bu tasarım, klasik Transformer modellere denk ya da daha iyi doğrulukla çok daha yüksek işlem hacmi vadediyor. Ailenin ortak özellikleri de iddialı: Super ve Ultra modellerde donanım duyarlı LatentMoE uzman tasarımı, uzun metin üretimini hızlandıran çoklu-token tahmini katmanları, NVFP4 hassasiyetinde eğitim ve 1 milyon tokene kadar bağlam uzunluğu. Eğitim sonrası aşamada ise çok ortamlı pekiştirmeli öğrenme ve çıkarım anında akıl yürütme bütçesi kontrolü bulunuyor.

Üç kardeş: Nano, Super ve Ultra

Küçük kardeş Nano, verimlilik dersi gibi okunuyor. Research sayfasındaki rakamlara göre model, gömülü katmanlarla birlikte 3,6 milyar olmak üzere yalnızca 3,2 milyar aktif parametre kullanıyor ve toplam büyüklüğü 31,6 milyar parametre. Buna rağmen GPT-OSS-20B ve Qwen3-30B-A3B-Thinking-2507 gibi kendinden katbekat büyük modellerden daha isabetli sonuçlar veriyor. Tek bir H200 üzerinde, 8K girdi ve 16K çıktı ayarında Qwen3-30B-A3B modeline göre 3,3 kat , GPT-OSS-20B modeline göre 2,2 kat daha yüksek işlem hacmine ulaşıyor. Uzun bağlamda da RULER testinde rakiplerini geride bırakıyor; ağırlıklar FP8 ve BF16 olarak, eğitim tarifi ve Nemotron-CC veri setleriyle birlikte açık paylaşılıyor.

Ortanca kardeş Super ise 10 Mart 2026 tarihinde yayınlandı ve çıtayı yükseltiyor. Research adresindeki Super sayfasına göre model, 12 milyar aktif ve 120 milyar toplam parametreli bir MoE; LatentMoE kullanan, MTP katmanı taşıyan ve NVFP4 ile ön-eğitimi yapılan serideki ilk model. Rakamlar sert: 8K girdi ve 64K çıktı ayarında GPT-OSS-120B modeline göre 2,2 kat , Qwen3.5-122B modeline göre 7,5 kat işlem hacmi, üstelik 1 milyon token bağlamda RULER skorunda da önde. NVFP4, FP8 ve BF16 denetim noktaları ile eğitim verileri açık; yani sonuçlar laboratuvarda kalmıyor, indirilebilir hale geliyor.

Masaüstünde süper bilgisayar: Spark ve Station

Modeller kadar donanım da hikayenin yarısı. Nvidia.com adresindeki DGX Spark sayfasına göre cihaz, GB10 Grace Blackwell süperçipiyle FP4 hassasiyetinde 1 petaFLOPS yapay zeka performansı sunuyor ve 128 GB birleşik sistem belleği sayesinde 200 milyar parametreye kadar modellerde çıkarım, 70 milyar parametreye kadar ince ayar yapılabiliyor. ConnectX ağ donanımı dört adede kadar Spark cihazını birbirine bağlayıp 700 milyar parametreye kadar ölçeklenmeye izin veriyor. Kompakt ve enerji verimli tasarım, sürekli çalışan ajan iş yükleri için düşünülmüş.

Ağabey DGX Station ise çıtayı masaüstünden veri merkezine taşıyor. Nvidia.com adresindeki Station sayfasına göre cihaz, GB300 Grace Blackwell Ultra masaüstü süperçipiyle 748 GB tutarlı bellek ve 20 petaFLOPS yapay zeka hesaplama gücü sunuyor; 1 trilyon parametreye kadar modelleri yerelde geliştirme, ince ayar ve çalıştırma iddiasında. Saniyede 800 gigabitlik ConnectX-8 SuperNIC iki Station cihazını birbirine bağlayabiliyor. Üzerinde Ubuntu tabanlı, CUDA-X kütüphaneleriyle önceden yapılandırılmış bir yazılım yığını geliyor; BMC telemetrisi ve Redfish desteğiyle BT ekiplerinin filoyu uzaktan yönetmesi de düşünülmüş.

Peki bunlar pratikte nasıl kuruluyor? Cevap, GitHub üzerindeki NVIDIA/dgx-spark-playbooks deposunda ve Build.nvidia.com adresindeki adım adım tariflerde. Nano için tarif basit: Docker içinde vLLM (v0.20.0 imajı), yerel Nemotron-3-Nano Omni ağırlıkları ve 8000 portunda çalışan bir sunucu. Super için iki yol var: akıl yürütme ayrıştırıcılı vLLM ya da TensorRT-LLM (1.3.0rc9) ile trtllm-serve ve ek bir yapılandırma dosyası. İkisi de Linux terminali, Docker GPU erişimi ve korumalı ağırlıklar için bir Hugging Face jetonu istiyor; ilk kurulum, ağırlık indirmeleri yüzünden onlarca dakika sürüyor ama risk düşük, her şey kullanıcı alanında kalıyor.

Videonun ikinci yarısındaki asıl mesaj ise ajanlar. Developer.nvidia.com adresindeki Haziran 2026 tarihli blog yazısına göre NVIDIA, kutudan çıkarıp yerel ajana giden yolu kısaltıyor: Haziran 2026 sistem yazılımıyla kablosuz güncellemeler ilk kuruluma zorunlu olmaktan çıkıyor, NemoClaw adlı açık kaynak planı tek komutla model, ajan iskeleti ve güvenli sandbox çalışma ortamı OpenShell yazılımını kuruyor. Qwen3.6 ile model performansı artarken, tek cihaza sığmayan ekipler için rehberli çok düğümlü küme kurulumu geliyor. Mantık açık: hassas bağlam cihazda kalıyor, jeton başı maliyet sıfırlanıyor, ajan üzerindeki kontrol kullanıcıda oluyor.

Son söz niyetine: tablo, bulut kiralamak ile masaüstü süper bilgisayar almak arasındaki çizginin inceldiğini söylüyor. Gizlilik hassasiyeti olan ekipler, sürekli çalışan ajanlar kurmak isteyen geliştiriciler ve 70 milyar parametreye kadar ince ayar yapacak araştırmacılar için Spark; trilyon parametre sınırını zorlayan laboratuvarlar için Station konumlanıyor. Ancak her iki durumda da ilk fatura donanımın kendisi ve indirme bekleme süresi; modeller açık olsa da elektrik, disk ve bakım masrafı ev sahibinin. Yerel yapay zeka olgunlaşıyor, ama cüzdan hesabı hâlâ şart.

Görsel: nodesdaily AI

Videodaki anahtar anlar

  1. Açılış: Nemotron modelleri neden yerelde koşar
  2. Nano ve Super için kurulum tarifleri
  3. DGX Spark ve Station donanım karşılaştırması
  4. Yerel ajanlar ve NemoClaw ile kapanış

AI yorumu

"Bulut faturası ödemeden, veriyi evden çıkarmadan büyük model koşturma fikri sonunda ete kemiğe bürünüyor; bu yazıdaki tablo da lehte. Yine de anlatıcının NVIDIA rozeti taşıdığını unutmadan okumakta fayda var: rakamlar etkileyici, ama bağımsız doğrulama şart."

AI değerlendirmesi

En güçlü itiraz bulut tarafında: saatlik kiralanan bir H200, satın alma maliyeti, elektrik ve bakım yükü olmadan aynı Nano modelini daha esnek çalıştırır; üstelik donanım eskidiğinde yükseltme tek tıkla olur. Ayrıca sunucunun öne sürdüğü 3,3 kat ve 7,5 kat gibi işlem hacmi çarpanları NVIDIA tarafının kendi ölçümleri; bağımsız tekrar testleri ve farklı iş yüklerindeki davranış henüz Research sayfalarındaki seçili kıyaslarla sınırlı. NVFP4 gibi 4-bit formatların doğruluktan ne götürdüğü de her görevde aynı değil, özellikle uzun bağlamda dikkat istiyor.

Eksikler de var. Yayın, güç tüketimi ve fan gürültüsü gibi masaüstü gerçeklerinden hiç bahsetmiyor; sürekli çalışan bir ajan kutusunun oturma odasında ne kadar ses çıkaracağı muamma. Fiyat bilgisi resmi sayfalarda yok, satıcı listelemeleri oynak. Korumalı ağırlıklar için Hugging Face jetonu ve lisans koşulları da atlanıyor; her model tek tıkla indirilemiyor. Ve bu makalenin kendisi bir web sentezi: videonun konuşma metnine erişilemedi, içerik resmi tarif ve ürün sayfalarından derlendi.

Konuşmacının çıkarı da ortada: bu bir NVIDIA Developer yapımı ve amacı açıkça ekosisteme davet; DGX satmak, NIM ve CUDA yığınını büyütmek. Bu durum rakamları yalan yapmaz ama çerçeveyi etkiler: rakip donanımlar, AMD ve Apple tabanlı yerel kurulumlar, hatta llama.cpp ile derlenen hafif yığınlar hikayede figüran kalıyor. NVIDIA Research verileri hakemli makale değil, şirket teknik raporu.

Okur için pratik çıkarım şu: halihazırda ajan altyapısı kuran, verisini buluta çıkarmak istemeyen ve 200 milyar parametre bandında çalışan bir ekipseniz Spark ciddi bir aday; deneme-yanılma maliyeti buluttan düşük. Ancak ayda birkaç kez büyük model deneyen biri için kiralama hâlâ mantıklı. Karar vermeden önce kendi iş yükünüzle küçük bir kıyas yapın, güç ve gürültüyü yerinde görün, sonra cüzdanı açın.

Kaynaklar

8 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.

nemotron · dgx spark · dgx station · yerel yapay zeka · açık modeller · nemoclaw

Konuyu takip et

Bu haberden önce

Aynı olayla editör tarafından ilişkilendirilmiş önceki haberlerden kısa bir okuma sırası.

Kanıt ve kaynaklar

İzinli kaynak metnini, sürümünü ve köken bilgisini incele.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…