Volver al inicio

¿Es Bonsai 27B realmente el 98 % de Qwen3 27B? Una prueba ternaria práctica en una sola RTX 3090

Digital Spaceport ejecutó el Bonsai 27B ternario de PrismML en una sola RTX 3090: una huella de 16,7 GB y 68 tok/s parecen sólidos, pero la calidad de generación arcade no respalda la afirmación del 98 por ciento en la práctica.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — 975ILFNTKfk
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

¿Puede una sola RTX 3090 ejecutar un modelo de 27 mil millones de parámetros lo bastante bien como para reemplazar a su gemelo de precisión completa? Esa es la pregunta que Digital Spaceport pone en el banco de pruebas, usando el Bonsai 27B ternario de PrismML. Los espectadores siguen preguntando cuál es el mejor modelo para una tarjeta o dos tarjetas pequeñas, y el episodio lo pone a prueba directamente. La afirmación principal enmarca la prueba: ¿una versión nueve veces más pequeña conserva casi toda la capacidad de Qwen3 27B?

Qué significa ternario — tres valores, nueve veces más pequeño

Ternario suena simple: cada peso vive en uno de tres estados, menos uno, cero, más uno, en lugar de dos. Ese tercer estado recorta el error de cuantización por grupo de escala. En las cifras que publica PrismML, un modelo 27B que ocupa unos 54 GB en 16 bits baja a unos 5,9 GB en ternario y 3,9 GB en binario. Una reducción de unas nueve veces, lo que coloca el modelo completo cómodamente dentro del presupuesto de una tarjeta de 24 GB.

La reducción no es un simple envoltorio. Bonsai se construye sobre Qwen3 27B, mueve alrededor de tres cuartas partes de sus capas de atención a forma lineal y mantiene una ventana de 262K tokens manejable en el dispositivo. La pila de lenguaje está comprimida de extremo a extremo — embeddings, proyecciones de atención, MLP y la cabeza LM comparten la misma representación de bajo bit sin bypass de alta precisión. La torre de visión se envía por separado en HQQ de 4 bits para que capturas de pantalla y documentos viajen con el texto. Un decodificador especulativo DSpark se añade encima como un impulso sin pérdida de tipo draft-and-verify.

El equipo — Proxmox LXC y una sola 3090

La configuración es un rig de autoalojamiento familiar: un contenedor LXC de Proxmox 9 numerado 118 en el host Prox 2. La descarga de Hugging Face es rápida porque el artefacto es lo bastante pequeño para saltarse la clave. El arranque pasa por el llama server starter de PrismML desde el repositorio de demostración. Un detalle clave es que el llama.cpp principal aún no lleva estos kernels de bajo bit aguas arriba, así que hay que usar el fork de PrismML para salidas correctas. La configuración del entorno enlaza BONSAI_HOST a 0.0.0.0, deja el tamaño de contacto en auto y mantiene el especulativo y la compresión del KV-cache desactivados para esta ejecución.

Una vez cargado, la tarjeta muestra unos 16,772 GB ocupados, dejando margen dentro de los 24 GB. El servidor queda accesible en 192.168.1.61:8080. El rendimiento inicial de chat ronda los 68 a 69 tokens por segundo y se mantiene ahí un rato. Como referencia, la anterior ejecución de Qwen3 27B de precisión completa en cuatro RTX 3090 con vLLM se quedó cerca de 40 tokens por segundo. El contexto se fija en 131K; subirlo tiene sentido para bucles de varios pasos al estilo Hermes Agent. La ruta de visión permanece activada.

Prueba arcade — mismas entradas, salidas diferentes

La prueba central es un enfrentamiento justo: el mismo paquete arcade generado previamente con Qwen3 27B de precisión completa se genera de nuevo con Bonsai. El agente estilo Hermes se activa, aparecen trazas de razonamiento, el procesamiento del prompt ronda los 1.250 tokens por segundo. Una generación ronda los 25.000 tokens, el trabajo del prompt es insignificante y el decodificado se estabiliza cerca de 64,4 tokens por segundo. Los resultados están previstos para juego lado a lado en arcade.digitalspaceport.com.

Cada uno de los tres minijuegos cuenta una faceta distinta. El shooter solo se mueve lateralmente, el flujo de enemigos se siente excesivo, la puntuación queda diminuta, unos 16.000 en la esquina superior izquierda, y el jefe dispara en la dirección equivocada. Las notas ahí caen entre C menos y D más. Space Racer se siente rígido, los cambios de carril son bruscos, la fuente diminuta no ayuda y los controles rozan lo injugable. Pixel Breaker sale mejor parado: la viñeta de la valla y el gato es decente, la música suena cursi pero el juego es más fluido, no a pantalla completa pero las estrellas rompibles reaccionan como se espera.

¿Es el 98 por ciento — la nota de campo

La calificación final en el vídeo es contundente: dos suspensos y un D más, con una calidad claramente por detrás de la ejecución de precisión completa. El presentador dice que no se siente como el 98 por ciento, y las rarezas en las capas creativas — lógica de niveles, música, pequeñas diferencias de puntuación — lo respaldan. La historia también encaja con las cifras de laboratorio: unos 80,49 frente a 85,0 en un promedio de 15 benchmarks, aproximadamente un 94,6 por ciento retenido. El promedio de laboratorio y una única generación creativa no son lo mismo; la segunda es más severa.

Donde brillan la velocidad y el uso de herramientas

El punto fuerte es la velocidad y el uso de herramientas. El chat se siente fluido, las llamadas a herramientas sin código funcionan bien y no se vieron llamadas fallidas en esta ejecución. Un decodificado de flujo único cerca de 68 tokens por segundo en una 3090 se traduce en hasta 134 tokens por segundo en ternario y 163 en 1 bit en una 5090, y alrededor de 58 y 87 en un M5 Max según las cifras publicadas. El impulso sin pérdida de 1,34x de DSpark forma parte de ese panorama. Es suficiente para que una sola tarjeta se sienta viable para un asistente persistente de un solo hilo.

El límite se traza en los agentes de código sostenidos. El episodio indica que está bien para chat y flujos de agente de un solo hilo, pero aún no es buen momento para el desarrollo de código agéntico. La razón es la caída de calidad vista en la generación de código creativa y estructural; incluso con contexto largo y atención lineal, la coherencia entre niveles se resiente. Hay margen de mejora a medida que los kernels del fork lleguen aguas arriba y crezca el presupuesto de contexto, y la configuración de dos 3060 de 12 GB tendrá su propia prueba de velocidad.

La conclusión práctica se liga a los precios del hardware. El tablero en vivo del canal muestra RTX 3090 de segunda mano cerca de 1.400 dólares y subiendo, mientras que una 3060 de 12 GB ronda los 300 dólares. La configuración doble de 3060 se prueba por separado en cuanto a velocidad. Una sola 3090 ya está en el umbral práctico de memoria y rendimiento. Elegir esta configuración tiene sentido si tu plan es un asistente, lectura de documentos y automatización ligera en una tarjeta; hacer de los agentes de código totalmente autónomos o la generación de juegos intensiva en visión la carga principal es prematuro.

Visualization: nodesdaily AI

Momentos clave

  1. Apertura — la pregunta de la 3090 única
  2. Lógica ternaria — menos uno, cero, más uno
  3. Configuración del contenedor 118 y llama.cpp forked
  4. Lectura de memoria — 16,772 GB ocupados
  5. Velocidad — 68 a 69 tok/s
  6. Generación arcade de 25K tokens
  7. ¿Es el 98 %? — dos notas débiles, una media

Comentario de la IA

""Lo que me llama la atención es cómo Bonsai lleva la densidad del papel a una sola tarjeta; aun así, hay que sopesar la caída en generación creativa antes de confiar en él para agentes de código sostenidos.""

Evaluación de la IA

Defendiendo a PrismML, la afirmación de laboratorio es sólida: unos 80,49 frente a 85,0 en un promedio de 15 benchmarks para el ternario, aproximadamente un 94,6 por ciento retenido, y 76,11, cerca del 89,5 por ciento, para 1 bit. Las mates cerca de 93,4 frente a 95,3, el código cerca de 86,0 frente a 88,7 y el conocimiento STEM cerca de 77,0 frente a 83,1 mantienen estrecha la brecha en las habilidades exactas que las cargas agénticas necesitan. El relato de atención híbrida y compresión de extremo a extremo se sostiene: cerca de tres cuartas partes de capas lineales más un KV-cache de 4 bits mantienen una ventana de 262K manejable en el dispositivo. En ese marco, afirmar una reducción de nueve veces sin pérdida dramática es defendible.

La prueba de campo arcade muestra que el promedio de laboratorio no se traduce uno a uno a la generación creativa. En los tres juegos, la lógica de niveles, las colisiones y el escalado de fuentes fallan; el jefe dispara en la dirección equivocada, la ubicación de la puntuación queda diminuta y el juego se vuelve repetitivo. Una generación de 25K tokens es una muestra delgada para afirmaciones amplias, y sin embargo dos notas débiles y un D más sugieren que el marco de marketing honesto es 94 a 95 por ciento en lugar de 98. La ejecución también usó un build forked de llama.cpp y contexto de 131K; la llegada aguas arriba y una ventana mayor podrían cerrar la brecha, pero la dependencia del fork es un coste hoy.

En verificabilidad, las cifras clave coinciden entre fuentes: 54 GB a 5,9 GB, una lectura de ocupación de 16,77 GB, unos 68 a 69 tokens por segundo en una 3090, y techos publicados cerca de 134 en ternario y 163 en 1 bit en una 5090, 58 y 87 en un M5 Max. Son valores repetibles en rigs independientes, no tallados en piedra. Otra pieza en movimiento es el precio del hardware: las 3090 de segunda mano cerca de 1.400 dólares han subido en los últimos días, lo que cambia mañana el cálculo del 27B de una sola tarjeta. Quedan lagunas de método también: sin pruebas multilingües, de documentos largos o de cadena de herramientas extendida en este episodio, así que el arcade por sí solo no demuestra competencia agéntica.

En la práctica, la elección depende del trabajo. Para chat diario, preguntas y respuestas sobre documentos, automatización ligera consciente de la visión y bucles de agente de un solo hilo estilo Hermes, Bonsai 27B ya es utilizable: corre en local, los datos permanecen en el dispositivo, el coste marginal es cero y la velocidad supera el listón. Si los agentes de código sostenidos, la generación de niveles de largo alcance o una salida creativa de alta fidelidad son la carga principal, el Qwen3 27B de precisión completa o un modelo frontera en la nube sigue siendo la apuesta más segura. La ruta doble de 3060 de 12 GB es un plan B económico; solo no esperes un viaje sin tropiezos sin contar los drivers y los kernels del fork.

Fuentes

7 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

bonsai 27b · ternario 1.58-bit · qwen3 27b · rtx 3090 · llama.cpp

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…