Volver al inicio

Qwen 3.8 27B en una sola tarjeta de 8GB: mejor de lo esperado

Red Stapler ejecuta Qwen 3.8 27B en una sola RTX 4060 de 8GB y lo pone a prueba con cuatro trabajos de creación web: generaciones de un solo intento sin bucles de agente, esperas de una hora y resultados comparados lado a lado con Opus 4.6.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — ye50BbXEczo
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

La afirmación inicial es clara: Qwen 3.8 27B funciona en una sola RTX 4060 con 8GB, y cada pieza mostrada se produjo de un solo intento, sin bucles de agente. El autor admite desde el principio que la configuración fue lenta y delicada al principio, pero aun así le resulta notable que un modelo de esta clase produzca trabajo terminado en una tarjeta tan modesta. El episodio promete la receta completa: la instalación, las elecciones de arnés y parámetros, y luego los resultados finales junto a Claude Opus.

El trasfondo es el momento del modelo: Qwen 3.8 salió unas dos semanas antes y rápidamente se convirtió en el tema favorito de la comunidad. A pesar de su tamaño relativamente pequeño de 27 mil millones de parámetros, se describe como igualando a Opus 4.6 en varios benchmarks de código y agentes, a veces superándolo. La mayoría de las guías recomiendan tarjetas de 24GB para él; este video explora el extremo inferior.

La idea clave viene del gráfico de cuantización: la versión IQ4XS se mantiene a unos seis por ciento del modelo base mientras lo reduce a unos 14GB. Eso pone en juego a las tarjetas de gama media de 16GB. El video va un paso más allá: ¿y 8GB — demasiado lento para molestarse? Hora de probar.

La configuración es frugal de principio a fin: el archivo IQ4XS de Unsloth, una ventana de 70K tokens considerada de sobra para un proyecto pequeño, y una caché KV cuantizada a 4 bits para ahorrar memoria de contexto. Unas 26 capas van a la GPU, manteniendo el uso total cerca de 7GB con margen para el sistema operativo.

El ajuste fino continúa: el grupo de hilos de la CPU se ajusta al número de núcleos físicos (seis en la máquina del autor), y la decodificación especulativa funciona en modo MTP con un máximo de dos tokens de borrador. El modo de pensamiento se activa sin el presupuesto de razonamiento, por una razón concreta — el modelo puede gastar unos 20K tokens solo pensando en un prompt de sitio web mediano, así que un límite lo abortaría a mitad de pensamiento. El muestreo sigue los valores compartidos por la comunidad: temperatura 1, top K 20, penalización de repetición 1, min P cero.

La elección del arnés se trata como algo de primer orden en 8GB: gana la herramienta con el prompt de sistema integrado más ligero, que es Pi. La lógica es directa — con la tarjeta ya en su límite de memoria, la inflación del arnés grava directamente el contexto y la velocidad, así que el runner más ligero evita que la carga de la tarjeta pequeña crezca.

El primer trabajo es una landing page 3D con temática de Minecraft. Al cabo de una hora, la generación se atasca en un bucle mientras escribe, y Pi corta la llamada de escritura. Al indagar aparecen dos correcciones: se desactiva el timeout HTTP porque la generación es tan lenta que los límites normales matan el trabajo, y se eleva el número máximo de tokens de salida para que sobrevivan los archivos grandes. El prompt se ejecuta de nuevo y termina tras dos horas y media a unos 4,2 tokens por segundo, empezando cerca de seis y decayendo a medida que crece el contexto.

Los otros tres trabajos terminan más rápido: una escena de ciudad neón cyberpunk en Three.js en aproximadamente hora y media a cinco tokens por segundo, un prompt detallado de sitio personal en unas dos horas a 4,6, y una landing page de diseño de interiores en hora y media a cinco. El mismo prompt se envía también a Opus 4.6, y el video alinea las dos salidas lado a lado cada vez.

El veredicto es audaz: Qwen 3.8 cambia las reglas del juego para los modelos locales. En 8GB el ritmo aún se considera demasiado lento para el uso diario, pero la calidad de salida de un modelo de este tamaño se califica de sólida — en algunas pruebas mejor que el lado de Opus 4.6. La proyección ofrecida es que una tarjeta de 16GB alcanza unos 12 a 14 tokens por segundo con 70K de contexto, lo cual cuenta como práctico.

Una pregunta de cierre recibe una respuesta directa: ¿por qué no la versión de 3 bits en el equipo de 8GB? Con una descarga pesada de CPU corría más lento que la versión de 4 bits, y las cuantizaciones no divisibles entre dos pagan una penalización de velocidad. La conclusión: quedarse en la banda de 4 bits para este tipo de configuración híbrida.

Visualization: nodesdaily AI

Comentario de la IA

""Para mí, este video saca el debate sobre los modelos locales de las tablas de benchmarks abstractas y lo pone sobre un escritorio real: con una tarjeta de 8GB, paciencia y los ajustes correctos, un modelo de clase 27B entrega trabajo de verdad.""

Evaluación de la IA

Para defender al otro bando: los trabajos de landing page de un solo intento favorecen a los modelos locales, y los modelos frontera de pago toman la delantera en repositorios multiarchivo desordenados y uso de herramientas a largo plazo. Por mi experiencia, el video nunca ejecuta ese escenario, así que leo su veredicto de mejor que Opus en algunas pruebas como acotado a ese género de página.

La lista de carencias es larga: 1,5 a 2,5 horas de reloj por trabajo, cuatro a cinco tokens por segundo, ajustes frágiles como timeouts y techos de salida, y el compromiso del contexto de 70K con KV de 4 bits. La proyección de 12 a 14 tokens para tarjetas de 16GB nunca se mide en este episodio, así que sigue siendo la proyección del autor, y la penalización de 3 bits es la observación de un solo equipo, no una regla general.

Para la verificación anclo la tabla a fuentes independientes: la afirmación de IQ4XS a la página de Unsloth y al benchmark de Quesma, el desbordamiento de pensamiento a una nota independiente sobre el sobrepensamiento, la elección de Pi a su documentación oficial, y la viabilidad de 8GB a una página externa de comprobación de compatibilidad. Revisaría cada cifra del video contra esas fuentes a la hora de decidir; los archivos de cuantización se actualizan en cuestión de semanas.

Mi conclusión: una opción genuina para estudiantes, curiosos, cualquiera que mantenga sus datos en el dispositivo, y dueños de tarjetas de 16GB — no para trabajo con plazos ni para 8GB como equipo de uso diario. También está la deuda de auditoría de entregar poderes de terminal a un runner: usar un arnés de código abierto implica comprometerse a leer lo que ejecuta.

Fuentes

7 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

qwen 3.8 · 27b · 8gb · modelo local

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…