Volver al inicio

M5 Ultra a prueba: memoria, almacenamiento y LLM local frente al M3 Ultra

Con M3 Ultra y el nuevo M5 Ultra lado a lado probé las promesas de Apple — hasta 4,3× en IA, almacenamiento doble y 1,2 TB/s — con los mismos modelos y stacks; los números respaldan el marketing, pero la ganancia percibida depende del largo del prompt.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — c_58D7ixOQI
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

Cuando el nuevo Mac Studio M5 Ultra llegó junto a mi M3 Ultra, la pregunta era directa: ¿se sostienen fuera de la diapositiva los hasta 4,3× en IA local, 2× en almacenamiento y 1,2 TB/s que promete Apple? La base arranca en $5.499 , la configuración de prueba GPU de 80 núcleos, 256 GB de memoria unificada y 8 TB sube a $14.299, con opción de 512 GB el mes próximo. Apple cedió el M5, el M3 es compra propia, así que pude correr mismos builds de Llama.cpp y MLX con idénticos modelos .

CPU y uso diario: primeras brechas medidas

En Speedometer el M3 Ultra marca 47 frente a 60,2 del M5; un núcleo M6 aislado es más rápido, pero el chasis Studio ya muestra el salto generacional. Para dev, una compilación .NET grande con 100k namespaces y clases baja de 71,7 s a 52,4 s, y una carga Python tipo Mandelbrot de 10,25 s a 5,8 s, cerca de 1,9× . La máquina es excesiva para solo código, pero las ganancias multicore e interpretadas son claras.

El almacenamiento supera el claim. En copia secuencial, ~ 6,5 GB/s lectura y 2,7 GB/s escritura en M3 vs 14,9 GB/s y casi 20 GB/s en M5; aleatorio de archivos pequeños también muy por encima de 2×. Cuando hay que cargar un modelo de 140 GB desde disco , esa diferencia recorta espera, y ambos discos eran de 8 TB para comparar en igualdad.

Ancho de banda y nuevo giro de arquitectura IA

En papel Apple declara 819 GB/s para M3 y 1,2 TB/s para M5. Con STREAM Triad , test de CPU, medí 312,9 GB/s vs 583,6 GB/s; el micro-benchmark de GPU , relevante para IA, dio 724 GB/s vs 1.039 GB/s , 1,4× real en M5. Ese ratio calca el alza vista en generación de tokens, sensible al ancho de banda.

El cambio de fondo: los núcleos GPU M3 eran solo gráficos, cada núcleo M5 integra ahora un acelerador neural dedicado a multiplicar matrices . Por eso el mismo binario Llama.cpp reporta `has_tensor = false` en M3 y `has_tensor = true` en M5, habilitando una ruta Metal afinada para la familia M5 . MLX , el stack propio de Apple, suele ser el más rápido, pero este gancho explica el salto de M5 en Llama.cpp. Builds y pesos idénticos en ambas.

Aquí importa la distinción procesado del prompt (PP) vs generación de tokens (TG) . PP — leer tu prompt — tira de cómputo y velocidad de núcleos GPU , TG — escribir la respuesta — tira de ancho de banda . M5 sube ambos, pero PP se beneficia más del acelerador por núcleo, por eso los prompts largos se despegan.

Cifras LLM: cuánto más rápido según modelo

En el gran MoE DeepSeek V4 Flash 284B , TG sube de 37 a 53 tok/s, 1,5× , PP de 483 a 1.485 tok/s, 3× . En GPT-OSS 120B , TG de 90 a 130 tok/s y PP de ~1.300 a 3.200 tok/s; con 32k tokens nuevos sobre 64k ya en contexto , el tiempo cae de 80 s a 56 s, de nuevo 1,4× . El patrón cuadra: TG sigue ancho de banda, PP sigue aceleradores.

En un Qwen3 27B denso , más pequeño pero donde cada token recorre todos los pesos, la carga es mayor. TG de 37 a 54 tok/s, 1,47× , PP de 430 a 1.800 tok/s, más de 4× . Un prompt de código realista de 14k tokens baja PP de 33 s a 8 s, 4,2× , confirmando el hasta 4× de Apple justo en contextos largos. La curva depende del largo: 1,6× a ~350 tokens , 3,4× cerca de 1.700, umbral 4× en torno a 4.500 , chat corto modesto, agente con archivos claramente ganador.

Potencia y térmica matizan. En generación la telemetría marcó 36W en M3 vs 45W en M5 , tokens por vatio +12 % solo; en reposo ~11–12W vs 8–10W, algo mejor M5. Bajo carga GPU sostenida, M3 pica cerca de 200W , M5 supera 400W , más caliente cerca de 43–44°C y claramente más audible. La eficiencia mejora, la potencia y calor absolutos también.

Un apunte más del banco: la ruta Metal de Llama.cpp ahora se bifurca para la familia M5 mientras la optimización por núcleo de MLX sigue evolucionando, así que el mismo silicio tiene dos picos distintos y el liderazgo cambia según modelo, contexto y cuantización.

En capacidad todo cupo hoy en 256 GB , pero la opción 512 GB que viene abrirá modelos aún mayores y despliegues más veloces. Con ocho peticiones concurrentes , el rendimiento agregado sube de 75 a 134 tok/s, el salto aguanta en concurrencia. Siguiente paso: MLX vs Llama.cpp y 8-bit a fondo; el balance provisional es claro — ~1,5× en TG y 2–4× en PP según largo , con agentes de código como mayor beneficiado.

Visualization: nodesdaily AI

Generación de tokens comparada (tok/s)

  • DeepSeek M337
  • DeepSeek M553
  • Qwen M337
  • Qwen M554
  • GPT-OSS M390
  • GPT-OSS M5130
Generación en modelos idénticos; más alto es mejor.
HallazgoValor
Subida ancho1,4× en GPU (724→1.039 GB/s)
Generación~1,5× en MoE y denso
Procesado prompt1,6× corto, 4,2× largo; umbral ~4.500
MétricaM3 UltraM5 Ultra
Ancho GPU724 GB/s1.039 GB/s
DeepSeek TG37 tok/s53 tok/s
DeepSeek PP483 tok/s1.485 tok/s
Lectura almacén6,5 GB/s14,9 GB/s
Python Mandelbrot10,25 s5,8 s

Momentos clave

  1. Intro — M5 Ultra junto al M3
  2. Precio y config: 256 GB, 80 GPU, 8 TB
  3. CPU: Speedometer y tiempos de compilación
  4. Almacenamiento: secuencial y aleatorio más de 2×
  5. Ancho de banda: STREAM y micro-bench GPU
  6. Arquitectura: acelerador por núcleo y ruta Metal
  7. LLM: PP y TG en DeepSeek y GPT-OSS
  8. Potencia y calor: pico 400W, 43°C y ruido

Comentario de la IA

"Mi lectura: el M5 Ultra es un salto serio en bruto, sobre todo para agentes de código con contexto largo. En chat corto la mejora es más sutil; para justificar una config de 14 k$ hay que alimentarlo con contextos amplios y modelos pesados."

Evaluación de la IA

Fuerza: protocolo transparente — mismos builds, mismos modelos, mismo tamaño de disco y mismas sondas de potencia. La correlación 1,4× ancho de banda → 1,5× generación se lee como medición, no marketing, y mostrar MoE vs denso el mismo día aporta valor real.

Límites: 1,6× en PP con prompts cortos , apenas perceptible en chat diario, y pico de 400W+ con 43–44°C — coste térmico notable; la eficiencia solo sube ~12 % mientras ruido y calor aumentan, en tensión con la promesa de estudio silencioso.

Lectura: M5 Ultra no es solo más rápido, es Apple reescribiendo la ruta Metal para inferencia local con un acelerador neuronal por núcleo . Deja huella incluso en stacks multiplataforma como Llama.cpp y, con la opción de 512 GB, empuja a Apple hacia modelos muy grandes para agentes de contexto largo.

En la práctica: si ejecutas agentes de código en contextos grandes, cargas 140 GB con frecuencia y sirves en concurrencia , el salto se nota; para chat corto y tareas ligeras el M3 sigue sobrado y más fresco/silencioso — que decidan largo del prompt y tamaño del modelo .

Fuentes

8 enlaces; 2 de ellos también citados por 4 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

m5 ultra · m3 ultra · mac studio · apple silicon · llm · ancho de banda · almacenamiento

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…