Retour au fil

Huit B300 face à Kimi K3 : les chiffres réels d'un test serveur à 128 utilisateurs

BIZON a évalué son serveur X9000 à huit B300 avec Kimi K3 : 100 tokens par seconde pour un utilisateur, 64 à 32 utilisateurs, 48 à 64 et 38 à 128 ; le point à 64 utilisateurs, soit 3 000 tokens au total, constitue le sweet spot.

Importé dans Nodesdaily : (UTC+03:00)
Voir sur YouTube — 5rGBUCFJJrk
Options de lecture

La lecture vocale n’est pas disponible dans ce navigateur.

Loupe à concepts

Choisissez un terme technique de cette vue pour lire sa définition générale, un exemple pédagogique et son usage dans l’article.

Aucun terme de notre glossaire n’a été trouvé dans cette vue. Le glossaire ne couvre pas encore tous les termes.

L'équipe BIZON a mis l'un des six serveurs destinés à des clients sur le banc d'essai avant l'expédition. La machine est le X9000 : un boîtier 5U de classe DGX embarquant huit B300. Des systèmes de ce type sont à la fois extrêmement chers et peu couverts, la vidéo comble donc un vrai vide. Sa valeur ne tient pas aux commentaires mais aux compteurs à l'écran : puissance, température et vitesse par utilisateur défilent côte à côte.

La configuration testée associe deux Intel Xeon à 128 cœurs avec 2 To de mémoire, et l'hôte plaisante sur le fait que les prix de la RAM piquent ces temps-ci. Huit B300 assurent le calcul. La page du vendeur liste cette machine à partir de 472 233 dollars avec 12 unités en stock, soit un coût par boîtier d'environ le budget technologique annuel d'une entreprise de taille moyenne.

Le châssis 5U se divise en deux étages. En haut se trouvent le mur de ventilateurs et les GPU sur rails ; on fait glisser le capot et l'énorme bloc de dissipateur de chaque carte apparaît. Les CPU et la mémoire vivent en dessous, les baies NVMe longent les côtés. L'arrière accueille les ports InfiniBand pour relier les serveurs, avec 800 Gb/s en XDR par carte et 1,8 To/s de bande passante NVLink de GPU à GPU selon la fiche technique du vendeur.

Un peu de contexte sur le B300 : silicium Blackwell Ultra, 288 Go de HBM3e par carte et une enveloppe de 1 100 W dans cette forme HGX. La vidéo annonce environ 280 Go utilisables par carte, ce qui colle au chiffre officiel. Une distinction compte : le chiffre de 1 400 W appartient au rack GB300 à refroidissement liquide, pas à un boîtier HGX refroidi par air comme celui-ci. Confondre les deux ruine d'emblée tout calcul de puissance et de refroidissement.

La charge de travail est Kimi K3, le modèle phare à poids ouverts de Moonshot : une architecture mixture-of-experts de 2 800 milliards de paramètres avec une fenêtre de contexte d'un million de tokens. Il se charge réparti sur les huit GPU à environ 266 Go par carte. Un fichier modèle d'environ 1,6 To tient donc en VRAM avec la fenêtre complète d'un million de tokens. C'est la revendication centrale de la vidéo : faire tourner un modèle de cette classe en pleine taille exige une machine de cette ligue.

Sous le capot tourne vLLM, le moteur de service open source que Nvidia recommande lui-même pour l'inférence multi-utilisateurs. L'équipe y a greffé une interface de test toute simple : on lance un prompt et on observe la vitesse de génération, l'utilisation, la puissance et la température sur un seul écran. Cette simplicité compte, car chaque affirmation repose ici sur l'observation, pas sur un tableau de scores synthétique.

Un utilisateur isolé obtient 100 tokens par seconde. L'équipe mentionne avoir brièvement touché 280 avec des réglages supplémentaires mais juge cette configuration instable ; elle rapporte donc la référence brute de 100, ce qui me semble le choix honnête. Dans ce test, les GPU tournent à pleine utilisation en tirant 596 W, autour de 52 degrés. Les longues sessions poussent certaines cartes vers 75-76 degrés, une courbe sensée pour du refroidissement par air depuis un repos à 44 degrés.

Puis cela devient sérieux : 32 utilisateurs simultanés, comme si des dizaines de personnes martelaient le même chatbot en même temps. La vitesse par utilisateur redescend à 64 tokens par seconde sans que personne ne bloque ; même l'utilisateur 32 continue de streamer. Le débit agrégé grimpe à 2 058 tokens par seconde à 614 W. Dire que c'est encore très bien n'est pas exagéré : servir 32 fois plus d'utilisateurs en conservant les deux tiers de la vitesse est un solide résultat.

À 64 utilisateurs, la machine délivre 48 tokens par seconde chacun et 3 000 par seconde au total, avec une puissance approchant 700 W. L'ingénieur parle de sweet spot, et je suis d'accord : 48 tokens par seconde, c'est parfaitement fluide en conversation. Notez la courbe de puissance qui monte pas à pas avec l'effectif, de 596 W à 700 W sur ces essais.

À 128 utilisateurs, chacun obtient encore 38 tokens par seconde, dans la zone exploitable. La tentative à 256 utilisateurs sature les cartes, et la métrique clé de la vidéo entre en scène : la latence P95, le vrai seuil du nombre de personnes qu'un boîtier peut porter à la fois. Le bilan est clair : un boîtier à huit B300 comme celui-ci n'est pas une machine mono-utilisateur mais une machine pour des dizaines de personnes appuyées sur le même modèle. Les options configurables de CPU et de mémoire figurent sur la page du vendeur.

Visualization: nodesdaily AI

Commentaire de l’IA

""C'est le regard le plus cru que j'aie vu sur les compteurs d'un serveur B300, et 48 tokens chacun à 64 utilisateurs m'ont convaincu : cette ligue, c'est celle du transport de foule, pas du sprint en solitaire.""

Évaluation de l’IA

L'acier d'abord : pour le prix d'un boîtier à 472 000 dollars, on pourrait louer des appels API pendant des années. Le tarif propre de Kimi K3 est de 3 dollars par million de tokens d'entrée, descendant à 0,30 dollar en cas de cache hit, soit environ un dixième des modèles fermés concurrents. Sauf si vous êtes une entité régulée dont les données ne peuvent pas sortir du bâtiment, l'équation de ce boîtier est rude. Les poids ouverts sont réellement attractifs, mais la facture tombe d'avance.

La méthodologie présente des lacunes : un prompt court, un modèle, des essais brefs. Le résultat à 256 utilisateurs n'apparaît jamais à l'écran ; un graphique P95 surgit mais le chiffre du seuil n'est jamais énoncé. Rien sur la stabilité en file d'attente longue, sur le thermique sous charge de plusieurs jours, ni sur la facture électrique et de refroidissement. Sans cela, les chiffres se situent quelque part entre la démo commerciale et les données de terrain.

Sur la vérifiabilité : c'est une vidéo de vendeur, filmée par l'équipe qui vend la machine. Le réglage à 280 tokens est écarté d'un revers de main comme instable, sans détail de mesure ; la référence de 100 tokens paraît honnête mais appelle une réplication indépendante. L'écart de 280 contre 288 Go n'est pas un problème : l'un est la capacité utilisable, l'autre la capacité nominale. Lisez chaque chiffre à travers ce prisme.

Mon verdict pratique : si vous servez un modèle à des dizaines de personnes à la fois, cette vidéo est la preuve qu'il vous fallait. Quarante-huit tokens à 64 utilisateurs et 38 à 128 s'insèrent directement dans un plan de capacité. Pour un utilisateur isolé ou un bricoleur occasionnel, la machine est surdimensionnée ; la même somme loue du cloud et fait tourner en interne des modèles ouverts plus petits. Je trancherais sur le seuil P95, pas sur la vitesse des gros titres.

Sources

6 liens ; 1 d’entre eux sont aussi cités par 1 autre article. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

b300 · blackwell ultra · kimi k3 · serveur gpu · vllm · inférence ia

Suivre le sujet

Avant cet article

Un court ordre de lecture des articles antérieurs reliés à cet événement par un éditeur.

Preuves et sources

Consultez les passages autorisés, leurs versions et leur origine.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…