La pregunta inicial es directa: con los nuevos Mac mini y Mac Studio anunciados, ¿deberías comprar una máquina nueva o quedarte con la que tienes? La respuesta depende de cuatro variables: qué quieres que haga el modelo, a qué velocidad lo quieres, cuánta memoria tienes y cuál es tu presupuesto. Todo el análisis pasa por una herramienta de comparación gratuita que el creador construyó: elige un Mac y mira qué modelos caben, o elige un modelo y mira qué Mac necesita. Si el video supera las cien mil vistas, la herramienta se hará de código abierto.
Empieza con categorías de capacidad en lugar de tablas de benchmarks crudos, preguntando qué puede hacer realmente cada modelo por ti. La primera categoría es de 38 a 48 GB: Qwen 3.8 27B, el modelo del día a día. Resumir un PDF de cincuenta páginas, redactar o explicar un contrato, escribir scripts, avanzar en una base de código tarea por tarea, todo eso queda aquí. Lo compara con Opus 4.6, un modelo de frontera de hace seis meses. El límite es claro: déjalo una hora en un gran trabajo de código o hazle preguntas de investigación de nivel experto y se queda atrás frente a la nube.
La segunda categoría ronda los 128 GB: Qwen 3.8 Flash y similares. Esto desbloquea el trabajo de oficina de varios pasos con herramientas: investigación en varios sitios, llenar una hoja de cálculo a partir de una pila de documentos, codificación multiarchivo más sólida con pruebas ejecutándose por su cuenta. Es un ajuste justo en una máquina de 128 GB y sufre si hay otras aplicaciones abiertas. Lo sitúa justo por debajo de Claude Opus 4.8, cerca de GPT 5.6 Terra. Es visiblemente más rápido y capaz que la categoría anterior.
La tercera categoría necesita al menos 256 GB: GLM 5.3 Flash. Este es el modelo que circuló de forma anónima y gratuita en OpenRouter como Ox Alpha antes de que Z.ai confirmara que era una versión GLM. Lo califica de nivel ingeniero: codificación a nivel de proyecto, bucles de prueba y corrección, sesiones más largas, entrada multimodal nativa. El tamaño total es grande, pero el diseño mixture-of-experts lee pocos datos por token, lo que aporta velocidad y bajo costo por token. DeepSeek V4 Flash es una alternativa en esta banda, pero lo considera menos capaz.
La cuarta categoría es de 512 GB, el techo actual de una sola máquina: GLM 5.2 y 5.3 completos. Con solo unos 54 mil millones de parámetros activos, la estructura MoE alcanza una capacidad cercana a la de los modelos insignia: trabajo experto, mejor codificación, sesiones autónomas más largas. El punto de referencia es GPT 5.6 Soul, con una advertencia: las sesiones largas traen más alucinación y pérdida de consistencia que los insignia de la nube. Aun así, un nivel sorprendente para un modelo ejecutado localmente.
La quinta categoría va más allá de un solo Mac: encadenar dos, cuatro o más máquinas para ejecutar modelos gigantes de forma distribuida. El ejemplo es Kimi K3, que necesita aproximadamente 1,5 TB de memoria en Q4, es decir, unas cuatro máquinas de clase Studio de gama alta. El resultado queda entre Opus 4.8 y Fable 5, el punto local más cercano a la frontera actual. Lo plantea como un ejemplo de techo para quienes tienen presupuesto e infraestructura, no para todos. El mensaje es explícito: todos quieren el más grande, pero no todos lo necesitan.
Estas categorías se contrastan con el Artificial Analysis Intelligence Index: Kimi K3 cerca de 50 frente a Fable 5 con 53, la familia GLM en la banda de GPT 5.6 Soul, Qwen 3.8 27B por debajo de Opus 4.8, GLM Flash por encima de Opus 4.8. El punto más llamativo es la tendencia temporal: a igual tamaño, los modelos se vuelven inteligentes rápidamente, y el salto de Qwen 3.6 a 3.8 lo demuestra. Así, una tarea que hoy requiere 256 GB podría resolverse en la banda de 48 GB en seis a doce meses. Comprar grande arregla el presente pero no asegura el futuro.
La física de la velocidad es el corazón del video. Cada token lee el modelo completo desde la memoria: Qwen 3.8 27B en Q4 significa unos 17 GB por token y hasta cuarenta tokens por segundo según la máquina; el archivo Q8 pesa 29 GB, así que las lecturas por token suben a 31 GB y la velocidad cae. El archivo GLM Flash ronda los 200 GB en Q4 pero solo lee unos 30 GB por token gracias a MoE, por lo que sigue siendo rápido pese a su tamaño. La cuantización (Q4/Q8) reduce los archivos, facilita el ajuste y cambia una pequeña pérdida de calidad por velocidad.
El techo es el ancho de banda de memoria: Mac mini M6 cerca de 170 GB/s, MacBook Pro M5 Pro 307 GB/s, M5 Max 460 a 614 GB/s, M5 Ultra 1,2 TB/s. El ejemplo desarrollado es Qwen 3.8 27B Q4 con contexto de 32k: unos 6,5 tokens por segundo en el M6, lo que se siente muy lento, 13 en el M5 Pro, 22 en el M5 Max, alrededor de 40 en el M5 Ultra. La ventana de contexto es la variable oculta: la caché es una fracción de gigabyte a 8k pero 17 GB a 256k, reduciendo la velocidad aproximadamente a la mitad. Sin embargo, el trabajo real de agentes necesita 128k o más; las comparaciones con ventanas pequeñas parecen rápidas pero engañan.
La sobrecarga del chip, el runtime y la aceleración completan el panorama. Existe un impuesto fijo por token de unos 4 ms en la generación M4 y 0,5 ms en el M5; apenas importa en modelos grandes pero domina en los pequeños y rápidos. En hardware idéntico, MLX corre hasta un cuarenta por ciento más rápido que GGUF basado en llama.cpp en modelos MoE, con una brecha menor en los densos. La predicción multi-token eleva el ejemplo de Qwen de 22 tokens por segundo a la banda de 34 a 56, y los métodos especulativos con modelo borrador van más lejos. En cambio, la RAM sobrante más allá del ajuste, los núcleos de CPU o el número de núcleos de GPU por sí solos no aumentan la velocidad de decodificación; el ancho de banda fija el techo y los gigabytes extra quedan ociosos.
Siguen los mapas de ajuste y velocidad de la herramienta. Qwen 3.8 27B Q4 con contexto de 32k cabe en todos los Mac listados; Flash corre en una máquina de 64 GB mediante paginación en SSD con una gran penalización de calidad; el umbral cómodo para GLM Flash es un M5 Ultra de 256 GB, con el M3 Ultra de 256 GB más lento como alternativa. Con contexto de 256k el panorama se endurece: la mayoría de las máquinas por debajo de 128 GB deben hacer concesiones, mientras que 128k de contexto cabe cómodamente en una máquina de 64 GB. En velocidad, el Mac mini M5 Pro de 48 GB arranca a 16 tokens por segundo en base y alcanza 58 acelerado; un M1 Max de 32 GB todavía lo ejecuta pero se calienta; el M5 Ultra de 512 GB proyecta 50 en base y hasta 180 acelerado en Qwen. En una máquina de trabajo debes restar las aplicaciones abiertas y el techo de memoria predeterminado de macOS del 67 al 75 por ciento; MLX reserva más que GGUF con prompts largos.
La comparación con la nube afila la economía: un M5 Ultra de 256 GB a casi diez mil dólares equivale a cuatro años de un plan mensual de doscientos dólares. Pero la mayoría del trabajo cabe en planes de veinte a cien dólares, los límites y restricciones de la nube siguen creciendo, algunos lanzamientos insignia se saturan rápido, y los modelos futuros pueden llegar tarde a los consumidores. Además, rara vez se requiere el mejor modelo. Los costos locales son carga de configuración: no hay memoria y conectores listos como en las apps de la nube, tú cableas el arnés tú mismo, incluida una configuración de agente como Hermes; el cálculo asume un chat activo, cuatro chats en paralelo significan cuatro veces la memoria; la privacidad es una ventaja pero la seguridad es tu responsabilidad, con riesgo de inyección de prompts y un alineamiento más débil; las puntuaciones de alucinación van por detrás de los insignia de la nube, con la banda de Qwen en negativo y GLM Flash en positivo de un solo dígito. De ahí una máquina por categoría: Mac mini M5 Pro de 48 GB para el Qwen básico, 128 GB para Flash, Studio M5 Ultra de 256 GB para GLM Flash, octubre de 512 GB para el GLM completo a un estimado de quince a dieciocho mil dólares. La velocidad cómoda es de 12 a 30 tokens por segundo, por debajo de 15 es lento, por encima de 30 es rápido.
La herramienta en sí es gratuita y sin registro: una lista de Apple Silicon desde el M1, una opción Nvidia DGX Spark, entrada de máquina personalizada, edición de modelo, cuantización y contexto, suposición de máquina de trabajo y elección entre GGUF y MLX, filtro de presupuesto. La matriz de ajuste muestra qué modelo cabe en qué máquina con qué compromiso, la tabla de velocidad muestra tasas por máquina y por modelo, la vista de modelo primero mapea un modelo en todos los Mac, la calculadora de memoria suma los modelos seleccionados. Cada celda es clicable: contexto máximo, cuantización máxima, proporción de memoria, velocidad esperada y fuentes de Hugging Face se despliegan; la fórmula de velocidad vive en una página aparte con reporte de números erróneos, además de exportación PNG y enlaces de configuración compartibles. El creador promete el código abierto a las cien mil vistas para que la comunidad pueda ampliar los datos de máquinas y modelos y corregir las fórmulas.
Comentario de la IA
""Lo que me llamó la atención es cómo este video invierte la pregunta: no se trata de cuánta RAM compras, sino de qué modelo ejecutas con qué ventana de contexto. Elige primero la tarea, luego la máquina; al revés se vuelve caro rápidamente.""
Fuentes
7 enlaces; 1 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=C9Q1ArLSisw
- @apple https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
También citado por: M5 Ultra Tested: Memory, Storage and Local LLM Speed vs M3 Ultra · 2026 Mac Mini and Mac Studio: From M5 Pro to M5 Ultra — Silent Speed and a 768 GB Memory Pool
- @modelfit https://modelfit.io/mac-studio/m5
- @explainx https://explainx.ai/blog/qwen-3-8-27b-open-weight-model-claude-opus-comparison-august-2026
- @openrouter https://openrouter.ai/z-ai/glm-5.3-flash
- @cellcog https://cellcog.ai/blog/glm-5-3-flash
- @muhammadraza https://muhammadraza.me/2026/gguf-vs-mlx-decision-guide
hardware · comprar · para · nica · guía · necesitas · nodesdaily