BIZON ekibi, müşteriye teslim edilecek altı sunucudan birini kargoya vermeden önce ölçüm masasına yatırdı. İnceledikleri makine X9000: Nvidia'nın DGX sınıfına denk gelen, 8 adet B300 taşıyan 5U bir canavar. B300'lü sistemler hem çok pahalı hem de hakkında adam akıllı test bulmak zor, o yüzden bu video niş bir boşluğu dolduruyor. Benim gözümde videonun değeri yorumda değil, ekrandaki sayaçlarda: güç, sıcaklık ve kullanıcı başına hız aynı karede akıyor.
Test edilen konfigürasyonun künyesi şöyle: CPU tarafında 128 çekirdekli iki Intel Xeon, bellek tarafında 2 TB RAM. Videoda da esprisi yapılıyor, bugünlerde bellek fiyatları el yakıyor. GPU tarafında 8 adet B300 var. Satıcının sayfasında bu makinenin başlangıç fiyatı 472.233 dolar görünüyor, stokta 12 adet yazıyor; yani tek bir kutu, orta ölçekli bir şirketin yıllık teknoloji bütçesi demek.
Kasa 5U ve iki katlı tasarlanmış. Üst katmanda fan duvarı ve kızaklar üzerinde GPU'lar duruyor; kapağı kaydırınca her bir kartın üzerindeki devasa soğutucu bloğu ortaya çıkıyor. Alt katmanda CPU ve bellekler, yanlarda NVMe yuvaları var. Arka yüzde ise sunucuları birbirine bağlayan InfiniBand portları dizili; üretici sayfasına göre kart başına 800 Gb/s XDR ve GPU'lar arası NVLink ile 1,8 TB/s bant genişliği söz konusu.
B300'ü kısaca yerine koyalım: Blackwell Ultra mimarisi, kart başına 288 GB HBM3e bellek ve bu HGX formunda 1.100 W güç zarfı. Videoda kart başına 280 GB civarı kullanılabilir bellekten söz ediliyor, resmi rakamla aradaki fark sürpriz değil. Önemli bir ayrım: 1.400 W'lık rakam sıvı soğutmalı GB300 raf sistemine ait; bu videodaki gibi hava soğutmalı HGX kutuda sınır 1.100 W. İkisini karıştırmak, güç ve soğutma hesabını baştan bozar.
İş yükü olarak Kimi K3 seçilmiş; Moonshot'un açık ağırlıklı amiral gemisi, 2,8 trilyon parametreli bir MoE mimarisi ve 1 milyon öbeklik bağlam penceresi taşıyor. Model 8 GPU'ya paralel yüklenmiş ve kart başına 266 GB bellek doluluğu görülüyor. Yani 1,6 TB mertebesindeki model dosyası, milyon öbeklik pencereyle birlikte VRAM'e sığıyor. Videonun iddiası da bu zaten: Kimi K3 sınıfı bir modeli tam boy çalıştırmak için bu ligde bir kutu gerekiyor.
Test düzeneğinin arka planında vLLM çalışıyor; Nvidia'nın da önerdiği, çok kullanıcılı çıkarım için optimize edilmiş açık kaynaklı sunucu motoru. Ekip bunun üzerine basit bir test arayüzü kurmuş: komutu veriyorsun, üretim hızını, GPU kullanımını, güç ve sıcaklığı aynı ekranda izliyorsun. Bu sadelik önemli, çünkü videonun bütün iddiası gözleme dayanıyor, sentetik bir kıyas tablosuna değil.
Tek kullanıcıda sonuç 100 öbek/saniye. Ekip bir ara 280'e kadar çıktığını ama ayarın kararlı çalışmadığını söylüyor, o yüzden ham taban değer olarak 100'ü raporluyorlar; bence doğru karar. Bu koşuda GPU'lar yüzde 100 kullanımda 596 W çekiyor, sıcaklık 52 derece civarında seyrediyor. Yük uzadıkça bazı kartlarda 75-76 dereceler görülüyor; boşta 44 derece olan kartlar için hava soğutmada makul bir eğri.
Sonra iş ciddileşiyor: 32 eşzamanlı kullanıcı, yani 32 kişi aynı anda sohbet robotuna yükleniyormuş gibi. Kişi başı hız 64 öbeğe düşüyor ama kimse takılmıyor, 32. kullanıcının akışı bile sürüyor. Toplam üretim 2.058 öbek/saniyeye çıkıyor, güç 614 W'a yükseliyor. Hâlâ gayet iyi yorumu abartı değil; 32 kat kullanıcıya karşılık hızın üçte ikisini korumak güçlü bir tablo.
64 kullanıcıda kişi başı 48 öbek, toplam 3.000 öbek/saniye görülüyor; güç 700 W'a dayanıyor. Videoyu çeken mühendisin tatlı nokta dediği yer de burası ve katılıyorum: 48 öbek/saniye akıcı bir sohbet hissi için fazlasıyla yeterli. Güç eğrisine dikkat: kullanıcı sayısı arttıkça her kartın çektiği güç adım adım yükseliyor, 596'dan 700'e gelen çizgi bunun kanıtı.
128 kullanıcıda kişi başı 38 öbek ölçülüyor; hâlâ kullanılabilir sınırın içinde. 256 kişilik denemede ise kartlar doygunluğa ulaşıyor ve videonun altını çizdiği metrik sahneye çıkıyor: P95 gecikme, yani sunucunun kaç kişiyi aynı anda taşıyabileceğinin gerçek eşiği. Sonuç cümlesi net: 8 B300'lü bu kutu, tek kişinin değil, onlarca kişinin aynı modele yüklendiği senaryonun makinesi. Yapılandırılabilir CPU ve bellek seçenekleri satıcının sayfasında listeleniyor.
Kişi başı hız kullanıcı sayısıyla düşüyor
- 1 kullanıcı100 t/s
- 32 kullanıcı64 t/s
- 64 kullanıcı48 t/s
- 128 kullanıcı38 t/s
| Kullanıcı | Kişi Başı | Toplam | Güç |
|---|---|---|---|
| 1 | 100 t/s | 100 t/s | 596 W |
| 32 | 64 t/s | 2.058 t/s | 614 W |
| 64 | 48 t/s | 3.000 t/s | 700 W |
| 128 | 38 t/s | paylaşılmadı | paylaşılmadı |
AI yorumu
"B300'lü bir sunucunun sayaçlarını ilk kez bu kadar çıplak görüyorum ve 64 kullanıcıda kişi başı 48 öbek beni ikna etti: bu lig, tekil hızın değil toplu taşımanın ligi."
AI değerlendirmesi
Karşıt görüşü en güçlü haliyle kuralım: 472 bin dolarlık bir kutu almak yerine aynı parayla yıllarca API kiralanır. Kimi K3'ün kendi tarifesi girdi tarafında milyon öbek başına 3 dolar, önbellek isabetiyle 0,30 dolara iniyor; rakip kapalı modellerin onda biri mertebesi. Verisi dışarı çıkamayan, regüle bir kurum değilseniz bu kutunun matematiği zor. Açık ağırlığın cazibesi gerçek ama faturası peşin.
Metodolojide boşluklar var: tek kısa komut, tek model, kısa süreli koşular. 256 kullanıcılı denemenin sonucu ekranda yok; P95 grafiği gösteriliyor ama eşik değeri sayı olarak verilmiyor. Uzun kuyruk kararlılığı, günler süren yükte termal davranış, elektrik ve soğutma maliyeti hiç yok. Bunlar olmadan tablo, tanıtım ölçümüyle saha verisi arasında bir yerde duruyor.
Doğrulanabilirlik cephesinde şunu not edeyim: bu bir satıcı videosu, kutuyu satan ekip çekiyor. 280 öbeklik ayar kararsız diye geçiştiriliyor, ölçüm detayı yok; 100'lük taban değer güvenilir görünse de bağımsız tekrar ister. 280'e karşı 288 GB farkı ise sorun değil: biri kullanılabilir, biri resmi kapasite. Rakamları okurken bu gözlüğü takmak lazım.
Pratik hükmüm şu: aynı anda onlarca kişiye model sunan bir ekipseniz, bu video aradığınız kanıt. 64 kullanıcıda 48 öbek, 128'de 38 öbek, gerçek bir kapasite planına girer. Tek kullanıcı ya da ara sıra deneme yapan bir ekip içinse bu kutu büyük gelir; o parayla hem bulut kiralanır hem de küçük açık modeller şirket içinde koşar. Ben olsam kararı P95 eşiğine göre verirdim, ham hıza göre değil.
Kaynaklar
6 bağlantı; 1 tanesi 1 başka haberde de kullanılıyor. Aynı bağlantıyı paylaşan haberler birbirini doğrulamış sayılmaz; kaynağın kökeni bağlantı sayısından çıkarılmaz.
- @youtube BIZON B300 sunucu incelemesi (video)
- @developer.nvidia.com https://developer.nvidia.com/blog/nvidia-blackwell-ultra-for-the-era-of-ai-reasoning/
- @kimi.com https://www.kimi.com/blog/kimi-k3
Aynı kaynağı kullanan: Çin'in Trilyon Parametreli Teknoloji Hamlesi: Ucuz Yapay Zeka ile Ekonomi Yarışı
- @bizon-tech.com https://bizon-tech.com/bizon-x9000-g5.html
- @blog.barrack.ai https://blog.barrack.ai/nvidia-b300-1400w-data-center-requirements/
- @tomshardware.com https://www.tomshardware.com/tech-industry/artificial-intelligence/moonshot-ai-releases-weights-for-kimi-k3-firing-a-shot-across-the-bow-of-openai-and-anthropic-open-weight-model-performs-almost-as-well-as-frontier-models-while-being-2-3x-easier-to-run
b300 · blackwell ultra · kimi k3 · gpu sunucu · vllm · yapay zeka çıkarımı