Volver al inicio

Ocho B300 se enfrentan a Kimi K3: cifras reales de una prueba de servidor con 128 usuarios

BIZON evaluó su servidor X9000 de ocho B300 con Kimi K3: 100 tokens por segundo para un usuario, 64 con 32 usuarios, 48 con 64 y 38 con 128; el punto de 64 usuarios, con 3.000 tokens en total, es el punto óptimo.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 5rGBUCFJJrk
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El equipo de BIZON puso en el banco de pruebas uno de los seis servidores destinados a clientes antes de enviarlo. La máquina es el X9000: una caja 5U de clase DGX que lleva ocho B300. Los sistemas así son a la vez extremadamente caros y poco cubiertos, así que el vídeo llena un vacío real. Su valor no está en los comentarios sino en los medidores en pantalla: potencia, temperatura y velocidad por usuario fluyen lado a lado.

La configuración probada empareja dos Intel Xeon de 128 núcleos con 2 TB de memoria, y el presentador bromea con que los precios de la RAM duelen estos días. Ocho B300 se encargan del cómputo. La página del vendedor lista esta máquina desde 472.233 dólares con 12 unidades en stock, así que una sola caja cuesta aproximadamente el presupuesto tecnológico anual de una empresa mediana.

El chasis 5U se divide en dos niveles. Arriba están el muro de ventiladores y las GPU sobre rieles; deslizas la tapa y aparece el enorme bloque disipador de cada tarjeta. Los CPU y la memoria viven abajo, las bahías NVMe recorren los laterales. La parte trasera lleva los puertos InfiniBand para enlazar servidores, con 800 Gb/s XDR por tarjeta y 1,8 TB/s de ancho de banda NVLink de GPU a GPU según la ficha del vendedor.

Algo de contexto sobre el B300: silicio Blackwell Ultra, 288 GB de HBM3e por tarjeta y un sobre de 1.100 W en esta forma HGX. El vídeo cita unos 280 GB utilizables por tarjeta, lo que cuadra con la cifra oficial. Una distinción importa: el número de 1.400 W pertenece al rack GB300 de refrigeración líquida, no a una caja HGX refrigerada por aire como esta. Mezclar ambos arruina de entrada cualquier cálculo de potencia y refrigeración.

La carga de trabajo es Kimi K3, el modelo insignia de pesos abiertos de Moonshot: un diseño mixture-of-experts de 2,8 billones de parámetros con una ventana de contexto de un millón de tokens. Se carga repartido entre las ocho GPU a unos 266 GB por tarjeta. Así, un archivo de modelo de unos 1,6 TB cabe en la VRAM junto con la ventana completa de un millón de tokens. Esa es la afirmación central del vídeo: ejecutar un modelo de esta clase a tamaño completo exige una caja de esta liga.

Bajo el capó corre vLLM, el motor de servicio de código abierto que el propio Nvidia recomienda para inferencia multiusuario. El equipo le acopló una interfaz de prueba sencilla: lanzas un prompt y observas velocidad de generación, utilización, potencia y temperatura en una sola pantalla. La simplicidad importa, porque cada afirmación aquí se apoya en la observación, no en un marcador sintético.

Un usuario solitario obtiene 100 tokens por segundo. El equipo menciona haber rozado 280 brevemente con ajustes extra, pero califica esa configuración de inestable, así que reportan la referencia bruta de 100, lo que me parece la llamada honesta. En esa prueba las GPU están a plena utilización consumiendo 596 W, rondando los 52 grados. Las sesiones largas empujan algunas tarjetas hacia 75-76 grados, una curva sensata para refrigeración por aire desde un reposo de 44 grados.

Luego se pone serio: 32 usuarios simultáneos, como si decenas de personas martillearan el mismo chatbot a la vez. La velocidad por usuario baja a 64 tokens por segundo sin que nadie se atasque; incluso el usuario 32 sigue recibiendo texto. La salida agregada sube a 2.058 tokens por segundo a 614 W. Decir que sigue siendo bueno no es exagerar: servir 32 veces más usuarios manteniendo dos tercios de la velocidad es un resultado sólido.

Con 64 usuarios, la máquina entrega 48 tokens por segundo a cada uno y 3.000 por segundo en total, con la potencia acercándose a 700 W. El ingeniero llama a esto el punto óptimo, y estoy de acuerdo: 48 tokens por segundo se sienten perfectamente fluidos en un chat. Fíjate en la curva de potencia subiendo escalón a escalón con el número de personas, de 596 W a 700 W en estas pruebas.

Con 128 usuarios cada uno aún recibe 38 tokens por segundo, dentro de la banda utilizable. El intento de 256 usuarios satura las tarjetas, y la métrica clave del vídeo entra en escena: la latencia P95, el verdadero umbral de cuántas personas puede cargar una caja a la vez. La conclusión es clara: una caja de ocho B300 como esta no es una máquina de un solo usuario, sino una caja para decenas de personas apoyadas en el mismo modelo. Las opciones configurables de CPU y memoria están en la página del vendedor.

Visualization: nodesdaily AI

Comentario de la IA

""Es la mirada más cruda que he visto sobre los medidores de un servidor B300, y 48 tokens cada uno con 64 usuarios me convencieron: esta liga va de transportar multitudes, no de esprintar en solitario.""

Evaluación de la IA

Primero el acero: por el precio de una caja de 472.000 dólares podrías alquilar llamadas de API durante años. La tarifa propia de Kimi K3 es de 3 dólares por millón de tokens de entrada, bajando a 0,30 dólares en aciertos de caché, aproximadamente una décima parte de los modelos cerrados rivales. Salvo que seas una empresa regulada cuyos datos no pueden salir del edificio, la matemática de esta caja es dura. Los pesos abiertos son genuinamente atractivos, pero la factura llega por adelantado.

La metodología tiene huecos: un prompt corto, un modelo, pruebas breves. El resultado de 256 usuarios nunca aparece en pantalla; surge un gráfico P95 pero el número del umbral nunca se enuncia. No hay nada sobre estabilidad con colas largas, térmicas bajo carga de varios días, ni sobre la factura de potencia y refrigeración. Sin eso, las cifras quedan en algún punto entre una demo de ventas y datos de campo.

Sobre la verificabilidad: es un vídeo de un vendedor, filmado por el equipo que vende la caja. El ajuste de 280 tokens se despacha como inestable sin detalle de medición; la referencia de 100 tokens parece honesta pero pide replicación independiente. La brecha de 280 frente a 288 GB no es un problema: uno es la capacidad utilizable, el otro la capacidad nominal. Lee cada cifra con esa lente.

Mi llamada práctica: si sirves un modelo a decenas de personas a la vez, este vídeo es la evidencia que necesitabas. Cuarenta y ocho tokens con 64 usuarios y 38 con 128 encajan directamente en un plan de capacidad. Para un usuario solitario o un aficionado ocasional, la caja es sobredimensionada; el mismo dinero alquila nube y aún ejecuta modelos abiertos más pequeños en casa. Yo decidiría por el umbral P95, no por la velocidad de los titulares.

Fuentes

6 enlaces; 1 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

b300 · blackwell ultra · kimi k3 · servidor gpu · vllm · inferencia ia

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…