Mirar un cursor girando durante tres minutos mientras los ventiladores rugen y un modelo gigante produce una sola palabra: ese era el presentador hace unas semanas. Un fin de semana haciendo correr un modelo de 125 mil millones de parámetros en un PC doméstico con llama.cpp, recompensado con 15 tokens por segundo en los días buenos y esperas de más de tres minutos antes de la primera palabra en peticiones largas. Luego apareció Strata en GitHub el 24 de septiembre, con cifras como 93 tokens por segundo en una tarjeta de 12 gigabytes dando vueltas. Parece la matemática de miniatura clásica a primera vista, pero una vez que la arquitectura interna del modelo se vuelve nítida, se convierte en una historia de ingeniería a tomar en serio.
En precisión completa, Qwen 3.8 Flash-Next es un modelo de 354 GB, unas 29 veces la memoria de la tarjeta que lo ejecuta, como pasar un crucero por una ventana de cocina. Y sin embargo Strata se instala con doble clic en Windows o un solo script en Linux, encuentra los archivos adecuados al sistema, descarga unos 70 GB y abre una ventana de charla. El mismo motor expone los mismos puntos de API que OpenAI y Anthropic, así que herramientas como Claude Code pueden apuntar directo a la máquina local. El proyecto reunió casi 4900 estrellas en ocho días, con hilos de foro llenos de usuarios publicando sus propias cifras de velocidad. Capturas y tablas de velocidad se publican en el repositorio del proyecto Strata en GitHub, cuyas cifras README muestran 94 tokens por segundo en 12 GB con la versión Q2_0.
125 mil millones de parámetros leyendo solo 4 GB por token
Contra lo que la mayoría supone, un modelo de 125 mil millones de parámetros no toca 125 mil millones de parámetros por palabra. La versión Q2 de 2 bits que Strata corre más rápido es un archivo de 66 GB, y cerca de la mitad consiste en expertos, pequeños módulos especialistas. Cada una de las 48 capas del modelo contiene 512 expertos, 24576 bloques en total, y por token cada capa solo elige 10 de sus 512 más uno compartido. En todas las capas, 480 expertos trabajan por token, cerca del dos por ciento del total. De 34 GB de datos de expertos, un solo token lee unos 0,66 GB, y con las partes siempre activas el total tocado es solo de 4 GB sobre un archivo de 66 GB. Las cifras de 125B de parámetros y 6B activos de este diseño de mezcla-de-expertos se verifican en la página Qwen de HuggingFace.
Casi la mitad del archivo, una porción de 29 GB, es una sola tabla de búsqueda de 51 mil millones de parámetros indexada por los últimos tres tokens vistos por el modelo. Como el modelo sabe exactamente qué filas necesitará antes de necesitarlas, Strata deja simplemente toda la tabla en el SSD y solo lee 16 filas por token, unos 23 kilobytes. Lo llamativo es que el equipo Qwen diseñó este modelo exactamente para este uso: la ficha del modelo dice que la estructura de incrustación se presta en especial a la descarga. Treinta y seis de las 48 capas usan un tipo de atención con memoria constante sin importar lo larga que se vuelva la conversación, mientras las 12 restantes no miran más de 48 posiciones atrás. Estas cuatro innovaciones se describen en los mismos términos en el repositorio Qwen en GitHub y en el artículo de arquitectura de AlibabaCloud, y el equipo Qwen cuenta este modelo como un anticipo del esfuerzo Qwen4.
Cuando se genera un token, cada una de las 48 capas encarga dos tareas a la tarjeta gráfica: el mecanismo de atención y un enrutador que elige los 10 expertos que este token necesita. Una vez establecida la lista, la tarjeta verifica cuáles de esos expertos ya guarda en memoria; una tarjeta de 12 GB conserva unos 4500 de 24576. Los que posee corren al instante en la GPU mientras los faltantes los calcula a la vez la CPU en la memoria del sistema, luego la tarjeta reúne ambos resultados, los suma y pasa a la capa siguiente. En la máquina de prueba, una vuelta completa toma unos 34 milisegundos, 15 para la GPU y 13 para la CPU, así que los dos procesadores trabajan de verdad en paralelo, esperándose uno al otro en cada capa. Los 4500 expertos en caché no son al azar; se cargan desde un perfil, un registro de los expertos más usados en muchas conversaciones. Sirviendo cerca de la mitad de todas las lecturas de expertos desde el primer mensaje, la caché trepa hacia un 72 por ciento de aciertos a medida que Strata aprende lo que la conversación actual repide. Esta caché de expertos es todo el motor; donde los motores viejos tratan la memoria de la tarjeta como el recurso escaso y la RAM del sistema como último recurso, Strata hace correr ambos como jugadores iguales.
El corazón del motor: caché de expertos y capa de borrador
El segundo truco, tras una gran parte de las ganancias reales, es una pequeña capa de predicción entrenada junto al modelo principal. Funcionando como un borrador barato y rápido, esta capa adivina hasta tres tokens por delante, luego el modelo grande ejecuta las 48 capas en una sola pasada para verificar las adivinanzas. Cada adivinanza aceptada se guarda más un token propio, así que cada pasada costosa produce en promedio entre 2,4 y 3,2 tokens en lugar de uno. En la misma máquina, el ritmo subió de 47-57 tokens por segundo sin el truco hacia la banda 82-92 con él. Si la calidad sufre tiene una respuesta neta en la prueba del equipo: aun con adivinanzas deliberadamente falsas impuestas, el texto salió idéntico a la ejecución sin predicción. Esta predicción multi-token trae un pequeño asterisco, pues en las versiones IQ la GPU y la CPU redondean la misma cuenta de expertos muy levemente distinto, así que una petición puede terminar de dos formas; la verificación del equipo contra llama.cpp coincide en el 97,5 al 99 por ciento de las posiciones. La llegada del soporte MTP general en el período de mayo de 2026 está documentada en el reporte de LLMRequirements.
La cifra de seis veces merece una mirada honesta. A mediados de septiembre, antes de que Strata existiera, su autor corrió la versión de 3 bits vía una herramienta basada en llama.cpp en el mismo PC que el de las cifras vedette, un RTX 5070 con CPU de seis núcleos y 64 GB de DDR5, y obtuvo 15 tokens por segundo, con una petición de 20000 tokens tomando 3 minutos 11 segundos antes de la primera palabra. El 18 de septiembre, la misma instalación estaba ajustada a 29 tokens por segundo. El valor vedette de 93 del proyecto Strata se midió en la versión de 2 bits; dividir 93 entre la corrida de 3 bits más lenta da 6,2. Comparar 3 bits con 3 bits deja el ratio en 2,1. En la que es probablemente la prueba más justa hasta hoy, un resultado de usuario en RTX 3090 puso al llama.cpp actual en 31 tokens contra 74 de Strata, una brecha de 2,4x, con el equivalente adivina-y-verifica apagado del lado llama.cpp. Nadie mintió; la referencia más lenta simplemente se dividió entre el resultado más rápido. El número que importa para las máquinas reales se sitúa entre 2x y 2,5x según el hardware y la versión, y pasar de 29 a 62 tokens por segundo en un PC de consumo sigue siendo un salto significativo.
Lo que el presentador habría querido que le dijeran de entrada: la GPU es casi lo último en que fijarse. Más memoria guarda más expertos en la tarjeta; el RTX 5090 de 32 GB guardó 17463 de los 24576 expertos y escribió 179 tokens por segundo en la versión de 2 bits mientras el 5070 de 12 GB se quedaba en 79 en la misma versión. Pero el lado CPU, que hace la mitad del trabajo, está acotado por el ancho de banda de memoria : el procesador tira unos 42 GB por segundo desde la memoria para la versión de dos bits, más o menos todo lo que el lado DDR5 puede dar. Como el lado DDR4 ofrece la mitad de esa banda, la mitad CPU de cada vuelta de capa toma cerca del doble de tiempo en una máquina DDR4; la tarjeta flamante espera a la CPU, que espera a su memoria. La máquina de prueba hacía correr su memoria a 5200 megatransferencias con el perfil de velocidad apagado en la BIOS; activar XMP o EXPO toma unos 30 segundos y compra aquí velocidad medible. El umbral que más importa es 64 GB de RAM: la versión de 2 bits quiere 34 GB para expertos más unos 10 para el sistema y todo lo demás.
La factura de memoria y la decisión honesta
La calidad es donde la compresión cuesta de verdad, y la tabla de cuantización dice el precio. El equipo tras los archivos cuantizados los calibró contra el modelo completo: la precisión completa marca 87,4 en la prueba de código en vivo mientras la versión Q2 de 2 bits que escribe 93 tokens por segundo se sitúa en 81,1, unos seis puntos detrás. El IQ3 de 3 bits aterriza en 86,3, un punto bajo el modelo completo, así que el archivo de 3 bits a 62 tokens por segundo es el del código y el de 2 bits el de la charla. Para la escala, en precisión completa Flash-Next supera al Qwen 3.8 de 27 mil millones de parámetros por menos de un punto en una prueba de código, 62,5 contra 61,7, así que la ventaja que toda la instalación existe para alcanzar ya está bajo el punto mientras la versión más rápida devuelve seis en otra prueba. La trepada del índice de precios se compara con precios de consolas de juego en la cobertura DDR5 actual de Tomshardware; 64 GB de DDR5-6000 se listaban a 913 dólares en el período de otoño contra un mínimo histórico de 159 dólares. La versión alojada cuesta 0,47 dólares por millón de tokens de salida, así que 913 dólares compran unos 1,9 mil millones de tokens; escribirlos a 93 tokens por segundo toma más de 240 días de marcha sin parar, y la copia alojada responde a muchas peticiones a la vez. Esa tarifa está confirmada como precio corriente en los datos de PricePerToken.
Un desarrollo enterrado cambia el cuadro: el 1 de octubre, llama.cpp integró la predicción multi-token ajustada para este modelo exacto, llevando la decodificación de 28 a 44 tokens, cerca de 1,55x, en una máquina con todo el modelo en memoria de tarjeta. El pero es que en las máquinas donde el modelo desborda a la memoria del sistema, lo que cubre a la mayoría de los espectadores, la misma función corrió más lenta; cada adivinanza extra tira a sus propios expertos desde la memoria a un costo superior a la ganancia. El reporte Strata muestra su propia ganancia en 1,6-1,8x porque la caché de expertos absorbe ese costo. La caché de expertos en sí sigue como un borrador abierto en llama.cpp desde el 28 de agosto, cuyo autor midió 18,4 subiendo a 24,2 tokens en dos tarjetas. Como Strata nace en parte del código de llama.cpp, la imagen es menos una toma de control que una carrera pública a dos funciones por la delantera. El veredicto es claro: un escritorio con 64 GB de DDR5 y una Nvidia de 12 GB o más ya encima debería instalarlo y correrlo; quien deba comprar la memoria de cero debería probar primero la tarifa alojada.
Momentos clave
- Una palabra en tres minutos: la lentitud en imagen
- Strata en escena: 93 tokens en 12 GB
- Solo 4 GB leídos por token
- Capas repartidas: GPU y CPU juntas
- Capa de borrador: 3 tokens por pasada
- La matemática honesta tras el 6x
- Límite real: la barra de 64 GB
- ¿913 dólares de RAM o la API?
- Veredicto: quién instala esta noche, quién espera
Comentario de la IA
"Lo que me entusiasma aquí no es la cifra de velocidad sino un modelo diseñado en torno al hardware que la gente ya posee. El presentador muestra la referencia en lugar de ocultarla, y una vez que se sabe de dónde sale el 6x, la historia deja de ser bombo para convertirse en una carrera que vale seguir."
Evaluación de la IA
El contraargumento más fuerte apunta al titular: en igualdad de condiciones, la ganancia es de 2 a 2,5x, y la versión más rápida es la más débil en código. La velocidad de 93 tokens pertenece a una cuantización seis puntos por debajo del modelo completo, mientras el archivo de 3 bits que cierra la brecha corre a 62. El récord de velocidad y el récord de calidad no viven en el mismo archivo, así que quien compre debe elegir cuál está pagando. La matemática del título no engaña a nadie en lectura atenta, pero igual puede mandar a un lector apresurado a la caja con expectativas de 6x.
Faltan piezas en el relato en pantalla: las cifras vienen de una sola máquina durante pocas semanas, y los usuarios de DDR4, las tarjetas portátiles y el lado AMD solo se tratan de pasada. La calidad a largo plazo, las tasas de error bajo cargas de agentes y la coherencia con 128K de contexto quedan como preguntas abiertas. Strata además es una versión 0.1 de ocho días, así que interfaces, perfiles y herramientas de depuración se moverán rápido. La posición del presentador merece una nota: un entusiasta declarado de la inferencia local que comparte la emoción, pero publica la referencia en lugar de ocultarla.
La regla práctica para el lector es simple: con 64 GB de DDR5 y una tarjeta de 12 GB o más ya sobre el escritorio, la instalación es velocidad gratis, con la versión de 3 bits para código, la de 2 bits para charla y el perfil de memoria activado en la BIOS. Si la memoria hay que comprarla nueva, unos millones de tokens en la API alojada deberían preceder a una compra de 900 dólares. La arquitectura pensada para la descarga parece el cambio duradero, mientras la brecha entre motores se cierra con peticiones públicas; lo que hay que mirar es la carrera misma, no el número.
Fuentes
8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Kai on running 125B models locally
- @github.com GitHub — Qwen3.8-Flash-Next repository
- @github.com GitHub — Strata engine repository
- @huggingface.co HuggingFace — Qwen3.8-Flash-Next model card
- @alibabacloud.com AlibabaCloud — Qwen3.8-Flash-Next architecture overview
- @tomshardware.com Tomshardware — DDR5 memory price surge
- @pricepertoken.com PricePerToken — Qwen3.8 Flash Next API pricing
- @llmrequirements.com LLMRequirements — multi-token prediction in llama.cpp
ia local · strata · qwen · memoria · cuantización · llama.cpp · hardware