Cuando el nuevo Mac Studio M5 Ultra llegó junto a mi M3 Ultra, la pregunta era directa: ¿se sostienen fuera de la diapositiva los hasta 4,3× en IA local, 2× en almacenamiento y 1,2 TB/s que promete Apple? La base arranca en $5.499 , la configuración de prueba GPU de 80 núcleos, 256 GB de memoria unificada y 8 TB sube a $14.299, con opción de 512 GB el mes próximo. Apple cedió el M5, el M3 es compra propia, así que pude correr mismos builds de Llama.cpp y MLX con idénticos modelos .
CPU y uso diario: primeras brechas medidas
En Speedometer el M3 Ultra marca 47 frente a 60,2 del M5; un núcleo M6 aislado es más rápido, pero el chasis Studio ya muestra el salto generacional. Para dev, una compilación .NET grande con 100k namespaces y clases baja de 71,7 s a 52,4 s, y una carga Python tipo Mandelbrot de 10,25 s a 5,8 s, cerca de 1,9× . La máquina es excesiva para solo código, pero las ganancias multicore e interpretadas son claras.
El almacenamiento supera el claim. En copia secuencial, ~ 6,5 GB/s lectura y 2,7 GB/s escritura en M3 vs 14,9 GB/s y casi 20 GB/s en M5; aleatorio de archivos pequeños también muy por encima de 2×. Cuando hay que cargar un modelo de 140 GB desde disco , esa diferencia recorta espera, y ambos discos eran de 8 TB para comparar en igualdad.
Ancho de banda y nuevo giro de arquitectura IA
En papel Apple declara 819 GB/s para M3 y 1,2 TB/s para M5. Con STREAM Triad , test de CPU, medí 312,9 GB/s vs 583,6 GB/s; el micro-benchmark de GPU , relevante para IA, dio 724 GB/s vs 1.039 GB/s , 1,4× real en M5. Ese ratio calca el alza vista en generación de tokens, sensible al ancho de banda.
El cambio de fondo: los núcleos GPU M3 eran solo gráficos, cada núcleo M5 integra ahora un acelerador neural dedicado a multiplicar matrices . Por eso el mismo binario Llama.cpp reporta `has_tensor = false` en M3 y `has_tensor = true` en M5, habilitando una ruta Metal afinada para la familia M5 . MLX , el stack propio de Apple, suele ser el más rápido, pero este gancho explica el salto de M5 en Llama.cpp. Builds y pesos idénticos en ambas.
Aquí importa la distinción procesado del prompt (PP) vs generación de tokens (TG) . PP — leer tu prompt — tira de cómputo y velocidad de núcleos GPU , TG — escribir la respuesta — tira de ancho de banda . M5 sube ambos, pero PP se beneficia más del acelerador por núcleo, por eso los prompts largos se despegan.
Cifras LLM: cuánto más rápido según modelo
En el gran MoE DeepSeek V4 Flash 284B , TG sube de 37 a 53 tok/s, 1,5× , PP de 483 a 1.485 tok/s, 3× . En GPT-OSS 120B , TG de 90 a 130 tok/s y PP de ~1.300 a 3.200 tok/s; con 32k tokens nuevos sobre 64k ya en contexto , el tiempo cae de 80 s a 56 s, de nuevo 1,4× . El patrón cuadra: TG sigue ancho de banda, PP sigue aceleradores.
En un Qwen3 27B denso , más pequeño pero donde cada token recorre todos los pesos, la carga es mayor. TG de 37 a 54 tok/s, 1,47× , PP de 430 a 1.800 tok/s, más de 4× . Un prompt de código realista de 14k tokens baja PP de 33 s a 8 s, 4,2× , confirmando el hasta 4× de Apple justo en contextos largos. La curva depende del largo: 1,6× a ~350 tokens , 3,4× cerca de 1.700, umbral 4× en torno a 4.500 , chat corto modesto, agente con archivos claramente ganador.
Potencia y térmica matizan. En generación la telemetría marcó 36W en M3 vs 45W en M5 , tokens por vatio +12 % solo; en reposo ~11–12W vs 8–10W, algo mejor M5. Bajo carga GPU sostenida, M3 pica cerca de 200W , M5 supera 400W , más caliente cerca de 43–44°C y claramente más audible. La eficiencia mejora, la potencia y calor absolutos también.
Un apunte más del banco: la ruta Metal de Llama.cpp ahora se bifurca para la familia M5 mientras la optimización por núcleo de MLX sigue evolucionando, así que el mismo silicio tiene dos picos distintos y el liderazgo cambia según modelo, contexto y cuantización.
En capacidad todo cupo hoy en 256 GB , pero la opción 512 GB que viene abrirá modelos aún mayores y despliegues más veloces. Con ocho peticiones concurrentes , el rendimiento agregado sube de 75 a 134 tok/s, el salto aguanta en concurrencia. Siguiente paso: MLX vs Llama.cpp y 8-bit a fondo; el balance provisional es claro — ~1,5× en TG y 2–4× en PP según largo , con agentes de código como mayor beneficiado.
Generación de tokens comparada (tok/s)
- DeepSeek M337
- DeepSeek M553
- Qwen M337
- Qwen M554
- GPT-OSS M390
- GPT-OSS M5130
| Hallazgo | Valor |
|---|---|
| Subida ancho | 1,4× en GPU (724→1.039 GB/s) |
| Generación | ~1,5× en MoE y denso |
| Procesado prompt | 1,6× corto, 4,2× largo; umbral ~4.500 |
| Métrica | M3 Ultra | M5 Ultra |
|---|---|---|
| Ancho GPU | 724 GB/s | 1.039 GB/s |
| DeepSeek TG | 37 tok/s | 53 tok/s |
| DeepSeek PP | 483 tok/s | 1.485 tok/s |
| Lectura almacén | 6,5 GB/s | 14,9 GB/s |
| Python Mandelbrot | 10,25 s | 5,8 s |
Momentos clave
- Intro — M5 Ultra junto al M3
- Precio y config: 256 GB, 80 GPU, 8 TB
- CPU: Speedometer y tiempos de compilación
- Almacenamiento: secuencial y aleatorio más de 2×
- Ancho de banda: STREAM y micro-bench GPU
- Arquitectura: acelerador por núcleo y ruta Metal
- LLM: PP y TG en DeepSeek y GPT-OSS
- Potencia y calor: pico 400W, 43°C y ruido
Comentario de la IA
"Mi lectura: el M5 Ultra es un salto serio en bruto, sobre todo para agentes de código con contexto largo. En chat corto la mejora es más sutil; para justificar una config de 14 k$ hay que alimentarlo con contextos amplios y modelos pesados."
Evaluación de la IA
Fuerza: protocolo transparente — mismos builds, mismos modelos, mismo tamaño de disco y mismas sondas de potencia. La correlación 1,4× ancho de banda → 1,5× generación se lee como medición, no marketing, y mostrar MoE vs denso el mismo día aporta valor real.
Límites: 1,6× en PP con prompts cortos , apenas perceptible en chat diario, y pico de 400W+ con 43–44°C — coste térmico notable; la eficiencia solo sube ~12 % mientras ruido y calor aumentan, en tensión con la promesa de estudio silencioso.
Lectura: M5 Ultra no es solo más rápido, es Apple reescribiendo la ruta Metal para inferencia local con un acelerador neuronal por núcleo . Deja huella incluso en stacks multiplataforma como Llama.cpp y, con la opción de 512 GB, empuja a Apple hacia modelos muy grandes para agentes de contexto largo.
En la práctica: si ejecutas agentes de código en contextos grandes, cargas 140 GB con frecuencia y sirves en concurrencia , el salto se nota; para chat corto y tareas ligeras el M3 sigue sobrado y más fresco/silencioso — que decidan largo del prompt y tamaño del modelo .
Fuentes
8 enlaces; 2 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube.com YouTube — Comparativa M5 Ultra vs M3 Ultra
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
También citado por: 2026 Mac Mini and Mac Studio: From M5 Pro to M5 Ultra — Silent Speed and a 768 GB Memory Pool · Buying a Mac for AI: The Only Guide You Need
- @apple.com https://www.apple.com/newsroom/2026/08/apple-introduces-m6-and-m5-ultra-for-a-big-leap-in-performance-and-ai-compute
También citado por: Apple's Impossible Double — 2-Nanometer in the Cheapest Mac, a Quad-Die Monster in the Priciest · MacBook Pro M6: 2nm Chip, a One-Chip Generation, and the Waiting Question
- @macworld.com https://www.macworld.com/article/3220024/apple-announces-the-m5-ultra-mac-studio-with-up-to-512gb-of-ram.html
- @applemust.com https://www.applemust.com/apple-m5studio/
- @arxiv.org https://arxiv.org/html/2607.19438v1
- @mactech.com https://www.mactech.com/2026/08/25/apple-introduces-new-mac-studio-with-m5-max-and-m5-ultra
- @tomsguide.com https://www.tomsguide.com/computing/cpus/the-usd3-999-m3-ultra-mac-studio-barely-beats-the-usd1-999-m4-max-in-leaked-benchmark
m5 ultra · m3 ultra · mac studio · apple silicon · llm · ancho de banda · almacenamiento