El mini-PC M5 de Bosgame invierte la lógica de la tarjeta gráfica: en lugar de 24 GB de VRAM separados, CPU y GPU integrada comparten un mismo pozo de 128 GB . La memoria unificada de AMD — Ryzen AI Max+ 395 (Strix Halo) donde procesador y gráfica beben de la misma memoria física — permite que un solo modelo supere el techo de 24 GB en más de cinco veces . La pregunta de The Stack es precisa: ¿poner tanta memoria en un escritorio por 3.000 $ lo convierte en la mejor opción para IA local, o caber el modelo más grande no es lo mismo que obtener la respuesta más rápida?
Qué significa realmente unificado — y por qué se siente más lento
En un sobremesa normal la CPU vive en su RAM y la tarjeta guarda su VRAM privada al otro lado del bus PCIe. Intentar cargar un modelo denso de 70.000 millones de parámetros en 24 GB hace que desborde hacia memoria lenta y se arrastre. El M5 elimina ese muro. Piensa el modelo como un libro enorme que debe quedar plano antes de leer una palabra — el escritorio compartido es ingente, los gigantes caben de una pieza. El susurro en la ficha es el ancho de banda: TechPowerUp mide el pozo compartido en ~256 GB/s , varias veces menos que los ~1.008 GB/s de una dedicada tipo RTX 4090. Producir cada palabra exige barrer los números del modelo, una vez por token, así que la velocidad del pozo, no solo su tamaño, dicta cuán rápido aparece el texto. En Linux el hardware gráfico no recibe todo el pozo por defecto; acercarse a los ~110 GB útiles citados por guías exige tunear el kernel para elevar la asignación.
Qué modelos caben y cuáles siguen rápidos es arquitectura. Un modelo denso — cada parámetro despierta por palabra — cabe incluso a 70B pero debe arrastrar 70B números por el bus cada token, reptando a 4-5 tokens/s . Un Mixture-of-Experts (MoE — diseño disperso donde solo unos expertos se activan por token) hace lo opuesto: un gigante de 120B mantiene una vasta biblioteca residente pero enruta cada palabra a solo 5-6B parámetros activos. Como abrir solo el estante correcto en una enorme biblioteca. Las mediciones del canal en este silicio lo muestran: Qwen3 y GPT-OSS 120B oscilan entre 15 y 56 tokens/s según el backend, mientras un MoE de 30B supera 70 tokens/s . Cuando el MoE pequeño es el más rápido, la arquitectura importa tanto como la capacidad.
¿Cuánta memoria hace falta? La regla 0,6 GB y cifras encontradas
Para estimar, Model Fit publica ~0,6 GB por mil millones de parámetros en 4-bit . Así 80B ~50 GB , 120B ~65 GB , ambos cómodamente bajo 110 GB. Aun así no hay velocidad única: Mine Studio ve GPT-OSS 120B a ~30 tokens/s y 35B por encima de 50 , mientras Model Fit lista una estimación no probada de 11 tokens/s para el grande. La dispersión son flags de compilación y runtime (llama.cpp, ROCm). La propia repetición del canal lo demuestra: el mismo Qwen reptaba a 1,79 tokens/s sin optimizar y saltó a 15,56 tokens/s con los flags correctos en el mismo silicio. La regla permanece: menos parámetros activos por token, menos datos cruzando el pozo y streaming más veloz.
El titular de AMD «2,2× más rápido que RTX 4090» solo tiene sentido en un carril. Para Llama 3.1 70B que no cabe en 24 GB, la 4090 debe sorber el desborde por el bus PCIe como maratonista con pajita de cóctel; el M5 mantiene todo el modelo en su pozo unificado más lento y la aritmética cuadra. Esa comparación CES 2025 se construyó sobre ese desborde. La comunidad r/LocalLLaMA vio la trampa de inmediato: Strix Halo no destronó al rey de sobremesa, AMD diseñó el banco más favorable. Cuando el modelo *sí* cabe en 24 GB, la dedicada es sustancialmente más rápida . Cambias velocidad de generación por capacidad bruta para meter gigantes en un chasis diminuto.
Leer el prompt no es escribir la respuesta
Generar texto son dos trabajos: prefill (ingerir todo el prompt de una vez) y decode (emitir token a token) . Decode va limitado por ancho de banda y el M5 lo resuelve razonable; los MoE grandes fluyen a velocidad conversacional. Prefill es cómputo paralelo puro. Antes del primer token el modelo debe digerir frases, snippets y aclaraciones pegadas — todo a la vez. Ahí la integrada Radeon 8060S , por ambiciosa que sea, se queda sin fuelle frente a una GPU de sobremesa. Los probadores de Strix Halo en Reddit describen esa fase como limitada por cómputo , cuello muy visible con prompts largos. El chat breve apenas lo muestra. Un asistente de código local sí: en cada turno empaqueta documentación, archivos enteros, árbol del proyecto y errores del compilador, volcando mucho más texto del que escribiste. Pedir renombrar una variable en todo el repo implica una larga ingestión antes de responder — cobrada en cada turno.
La configuración es proyecto aparte. Windows ve la caja como un sobremesa educado y reserva solo una porción cautelosa para gráficos; debes elevar la asignación tú mismo antes de cargar algo grande, y el menú se mueve según máquina y driver. Luego el software pesa más que el silicio: llama.cpp en el mismo Qwen salta de 1,79 a 15,56 tokens/s solo con flags y backend. La pila ROCm es blanco móvil: un desarrollador pasó 9 meses en cuatro releases de ROCm en una caja de 96 GB intentando arrancar el motor VLM sin éxito, luego reportó que en releases nuevas funciona sin los rodeos que lo habían bloqueado — mientras otros en hardware idéntico aún deben compilar desde fuente. Antes de comprar para una herramienta concreta, verifica su estado *actual* ROCm/llama.cpp en lugar de fiarte de una reseña fechada.
La realidad del precio: de 1.699 a 2.999 $, pico de 3.847 $ y memoria soldada
Solo el precio ya es lección. Lanzamiento 1.699 $ por 128 GB ; hoy el escaparate Bosgame marca 2.999 $ — salto de 1.300 $ . Guru3D reportó el precio intro cuando solo existía 128 GB. La versión 96 GB es algunos cientos menos, pero la disponibilidad manda: todos los listados viejos baratos están agotados, lo único que importa es el precio de la config realmente comprable. Model Fit vio una caja comparable rozar 3.847 $ en julio de 2026 en el pico de escasez de memoria; la misma gama había arrancado cerca de 2.000 $ . Una máquina que es sobre todo memoria se mueve con el precio de la memoria. Y esa memoria es LPDDR5X soldada — cableada a la placa porque la interfaz rápida lo exige. No abres la caja y añades módulos. Pagar 3.000 $ por una caja no ampliable cambia la ecuación; de ahí el consejo: compra exactamente el tamaño que tu mayor modelo previsto exige, no el escalón más barato que puedas convencerte.
Apartado el ruido de marketing, la conclusión se afina. La promesa Bosgame «juego igual a RTX 4070» y la gran cifra TOPS en la ficha pertenecen al rincón del vendedor; la primera es diapositiva comercial, la segunda cuenta la NPU (procesador neuronal) mientras todas las mediciones aquí usaron el lado gráfico. Más importante, cada competidor alrededor de este silicio AMD usa misma CPU y misma arquitectura gráfica ; ver Ryzen AI Max+ 395 en el listado significa motor idéntico — el M5 es una forma de comprar este chip, no la forma obvia. A su precio actual, comparar calidad de construcción, soporte y garantía vale la pena. La lección única: capacidad (qué puedes cargar) y velocidad (qué rápido fluye) son preguntas separadas . El M5 ofrece un lujo raro — MoEs fronterizos enormes retenidos localmente y en silencio — emparejado con la experiencia humilde de verlo masticar prompts largos a su ritmo pausado. Una ficha generosa en uno no dice nada del otro.
Comparación ancho de banda
- M5 unificada (256)256 GB/s
- RTX 4090 (1008)1.008 GB/s
| Métrica | M5 Strix Halo | RTX 4090 |
|---|---|---|
| Memoria | 128GB unificada | 24GB VRAM |
| Ancho banda | ~256 GB/s | ~1.008 GB/s |
| Denso 70B | 4-5 tok/s | desborda -> lento |
| MoE 120B | 15-56 tok/s | no cabe |
| Precio lista | $2.999 (128GB) | ~$1.599 |
Momentos clave
- La pregunta: ¿qué ejecuta un mini-PC de 3.000 $?
- Derribar el muro: memoria unificada 128 GB
- Analogía del escritorio y 256 GB/s
- MoE vs denso: 5-6B activos vs 70B a 4-5 tok/s
- MoE 120B 15-56 tok/s, MoE 30B 70+ tok/s
- El 2,2× vs 4090 y la pajita PCIe
- Prefill vs decode: límite de cómputo en prompts largos
- Asistente de código ingiere el repo cada turno
- 1,79 a 15,56: los flags deciden la velocidad
- 1.699 → 2.999 → 3.847: precio y LPDDR5X soldada
Comentario de la IA
"Mi lectura: no es un demonio de velocidad, es un demonio de capacidad. Mantener un MoE enorme en local a velocidad conversacional es atractivo; esperar que un asistente que ingiere miles de líneas en cada turno siga ágil es confundir capacidad con velocidad."
Evaluación de la IA
En su mejor versión, el caso es coherente: si quieres un MoE grande retenido local y en silencio, un pozo unificado de 128 GB que aloja 120B en ~65 GB y hace fluir el chat es una respuesta práctica rara. El pivote es la arquitectura — 5-6B parámetros activos por token alivian el ancho de banda y abren la franja 15-56 tokens/s vista en pruebas. Así leído, el M5 es un canje deliberado: velocidad pura por capacidad a cambio de privacidad y acceso permanente.
Los límites son claros: pozo enorme pero lento (256 GB/s), densos colapsados a 4-5 tokens/s y GPU integrada limitada por cómputo en prompts largos, con pausa de ingestión notable antes de cada turno con contexto de repositorio. La configuración es sensible — asignación en Windows más flags ROCm/llama.cpp explican el salto 1,79 a 15,56 tokens/s en el mismo silicio — y la saga VLM de 9 meses muestra software más volátil que hardware. Hay además hueco metodológico: no existe velocidad única de referencia, cada fuente mide con backends/flags distintos, así que cualquier generalización es frágil.
Para intereses y verificabilidad, lea los titulares con cuidado: «2,2× sobre 4090» solo vale cuando la carga desborda 24 GB; cuando cabe, la dedicada gana. Las promesas de juego/TOPS cuentan la NPU, fuera del alcance de las mediciones gráficas aquí. El precio también importa: 1.699 a 2.999 $ hoy, 3.847 $ en el pico de memoria de julio 2026, y LPDDR5X soldada ata el coste al ciclo de memoria sin vía de ampliación. Hay mediciones independientes por piezas (Mine Studio, Model Fit, repeticiones internas) pero no como comparación controlada única, así que cada velocidad debe leerse como «qué backend, qué flags, qué asignación».
En la práctica: si tu tarea es chat local con MoE grande y disperso y valoras caja pequeña y silenciosa, el trío modelo disperso grande + backend correcto + ~110 GB de asignación puede funcionar. Para trabajo de contexto largo y re-ingestión frecuente como asistente de código, el techo de cómputo integrado muerde — presupuesta la pausa de ingestión en cada «arregla todo el repo». Al comprar, dimensiona la memoria al mayor modelo que realmente planeas ejecutar, no al escalón más barato que te autoconvenzas; como cada competidor en torno a este silicio AMD usa el mismo motor Ryzen AI Max+ 395, compara por calidad de construcción, soporte y garantía manteniendo capacidad vs velocidad como dos preguntas separadas.
Fuentes
8 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — The Stack: qué ejecuta realmente un mini-PC de 3.000 $
- @amd.com https://www.amd.com/en/developer/resources/technical-articles/2025/amd-ryzen-ai-max-395--a-leap-forward-in-generative-ai-performanc.html
- @amd.com https://www.amd.com/en/products/processors/desktops/ryzen/ryzen-ai-halo/ryzen-ai-max-plus-395.html
- @notebookcheck.net https://www.notebookcheck.net/AMD-Strix-Halo-lineup-led-by-Ryzen-AI-Max-395-zealously-aims-to-overtake-Apple-M4-Pro-Core-Ultra-9-288V-2x-faster-than-RTX-4090-in-AI-with-87-less-power.941958.0.html
- @hothardware.com https://hothardware.com/news/amd-strix-halo-rtx-4070-mem-bw
- @github.com https://github.com/botAGI/strix-halo-llm-benchmarks
- @amd.com https://rocm.docs.amd.com/projects/ai-ecosystem/en/latest/inference/llamacpp.html
- @bosgamepc.com https://www.bosgamepc.com/en
bosgame m5 · strix halo · memoria unificada · moe · ia local