Volver al inicio

M5 Max de 128 GB tras 5 meses: ¿hasta dónde se puede llegar con la IA local?

El creador detrás de Execute Automation repasa cinco meses con un MacBook Pro M5 Max de 128 GB como equipo principal: inferencia de modelos en local, fine-tuning, agentes de programación y lo que se siente con 614 GB/s de ancho de banda en la práctica.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — jzqBtld_iIg
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El creador explica que ha usado un MacBook Pro M5 Max con 128 GB de memoria unificada como equipo principal durante cinco meses. En su planteamiento, es actualmente la configuración más alta disponible en formato MacBook Pro, cargando toda su carga de trabajo en una sola máquina. El vídeo plantea una pregunta afilada: hasta dónde se puede llevar este hardware para la IA local y dónde choca contra el muro.

El stack de IA local no es una sola aplicación: LM Studio, runners basados en MLX, Ollama y llama.cpp conviven lado a lado. En cuanto a los modelos, ha probado varios tamaños de las familias Qwen, Gemma y GLM. Gracias a la memoria unificada, los grandes archivos de pesos se comparten entre CPU y GPU sin copiar, lo que mantiene todo el montaje práctico.

Los agentes de programación cambian el panorama: los asistentes locales responden tan rápido que la experiencia a veces se siente como estar conectado a un modelo en la nube. La edición con contexto amplio y la navegación por todo el proyecto funcionan con fluidez en la máquina. Para él, esa fluidez cotidiana es más convincente que las cifras brutas de los benchmarks.

El calor y el ruido se dividen según el tamaño del modelo: con modelos de pocos parámetros la máquina se mantiene fría y silenciosa, con los ventiladores apenas girando. Los modelos grandes invierten el panorama, especialmente los lanzamientos más recientes de clase Flash, donde los ventiladores funcionan constantemente y el calor desprendido es evidente. El silencio no está garantizado; depende de la carga de trabajo.

El segmento de fine-tuning es una de las sorpresas del vídeo: usa el framework MLX de Unsloth para ajustar grandes modelos de lenguaje con sus propios datos, y califica el resultado de sorprendentemente fluido en este portátil. También ha preparado un curso sobre fine-tuning con modelos locales para quienes quieran profundizar. Entrenar en un portátil sonaba a fantasía hace unos años; aquí se presenta como rutina.

Entre los modelos que menciona hay un modelo denso de 27 mil millones de parámetros de la familia Qwen, un modelo mixture-of-experts Flash Next y la versión 5.3 Flash de GLM. Reconoce con franqueza que la latencia varía según la longitud del contexto, el tipo de consulta y la utilización de núcleos. Aun así, su veredicto general es positivo: las esperas varían, pero los trabajos se completan y la máquina nunca lo deja tirado.

Comparado lado a lado con su antiguo M1 Max, reporta diferencias de hasta 8x, atribuyéndolas a los bloques de aceleración de IA dentro de la GPU. La ganancia se nota no solo en las respuestas del chat, sino en la generación de imágenes y el entrenamiento de transformers. El propio vídeo fue editado y renderizado en esta máquina; se destacan los proyectos grandes con muchos recursos y las exportaciones rápidas en Final Cut Pro y Camtasia.

El ancho de banda de memoria se cita en 614 GB/s y se presenta como la razón por la que esta máquina destaca. Frente a su M4 mini, la diferencia se describe como varios múltiplos, y el mini recién anunciado tampoco se le acerca. El salto de ancho de banda del M1 Max al M5 Max muestra cuánto se ha ampliado la brecha.

La historia de los precios es la parte más concreta: compró la máquina en abril por unos 11.599 dólares neozelandeses. La posterior subida de los precios de memoria elevó la misma configuración en unos 5.000 NZD, un aumento del 30-40 por ciento. Comprar pronto le dio una ventaja seria; la misma decisión al precio actual sería mucho más difícil.

En la demostración en directo, un modelo mixture-of-experts de 26 mil millones de parámetros de la familia Gemma 4 funciona con cuantización de 4 bits y un módulo de especulación acelerado activado. El modelo se carga por completo en memoria en la primera ejecución, el Monitor de Actividad muestra unos 46 GB en uso y la presión de memoria se mantiene en verde. La velocidad de generación ronda los 108 tokens por segundo en preguntas y respuestas, llegando a 150 con prompts ligeros.

También señala experimentos anteriores: resultados con el modelo de 27 mil millones de parámetros de Qwen, generación rápida de imágenes SVG y una migración completa de .NET 8 a .NET 10, incluidas las actualizaciones de librerías, terminada en minutos. El módulo de especulación acorta visiblemente estos trabajos de varios pasos. Un asistente de programación local funcionando a esta velocidad es la demo más contundente del vídeo.

En el lado positivo: portabilidad, uso diario silencioso, inferencia fluida en la clase de 27-32 mil millones de parámetros y fine-tuning en el propio portátil; la máquina parece preparada para el futuro en esa clase. En el lado negativo está el techo: los grandes modelos actuales ya pueden acercarse a 121-122 GB de memoria virtual, y con el sistema operativo más la sobrecarga de cuantización, el límite de 128 GB está al alcance. Si un futuro modelo necesita 192 o 256 GB prometiendo un rendimiento local de clase Claude, esta máquina no bastará.

Cierra señalando que los Mac solían estar sobre los escritorios durante diez años, mientras que el hambre de memoria podría dejar esta máquina anticuada en un par de años. Los planes de Apple de ejecutar sus propios modelos de IA en estas máquinas forman parte de la ecuación. Aun así, está contento con la compra, y sugiere a quien espere un M6 o un M6 Ultra que decida con este panorama en mente antes de agradecer a los espectadores y despedirse.

Visualization: nodesdaily AI

Comentario de la IA

""Lo que me parece honesto de este vídeo es cómo mantiene el elogio y la advertencia en un mismo aliento: 128 GB son el punto óptimo hoy, pero a este ritmo de apetito de los modelos podría convertirse en el techo.""

Evaluación de la IA

Para defender el otro lado: los defensores de las API en la nube dicen que el tiempo vale más que el hardware, y pagar unos dólares de tarifas de API en lugar de pelearse con un modelo local atascado es racional para la mayoría de los equipos. Guías independientes coinciden, señalando que un portátil de 4.000 dólares todavía pierde algunos trabajos frente a un escritorio con GPU de 2.000 dólares. Creo que esa objeción reduce el alcance del vídeo sin refutarlo: para aprender, experimentar y mantener los datos en el dispositivo, el montaje local es una opción real.

Hay lagunas metodológicas: se trata de un informe de experiencia de una sola máquina, un solo usuario y sin controles. Los 108-150 tokens por segundo que aparecen en pantalla provienen de un pequeño modelo mixture-of-experts, mientras que las clasificaciones independientes sitúan los modelos densos de 70 mil millones de parámetros en esta clase de hardware en 15-18 tokens por segundo. La afirmación sobre el fine-tuning no tiene tiempos ni curvas de pérdida que la respalden, y las observaciones de calor se quedan en la sensación en lugar del termómetro.

El enfoque de interés y verificabilidad también importa: el presentador compró la máquina con su propio dinero y promociona un curso de pago sobre el tema, lo que añade un optimismo natural a cualquier afirmación de satisfacción. Afortunadamente, las cifras clave se cruzan con fuentes independientes: el ancho de banda de 614 GB/s y la subida de los precios de memoria están confirmados por las propias declaraciones de Apple. Aun así, yo volvería a comprobar las velocidades de tokens y los precios contra los listados actuales a la hora de decidir, ya que ambos cambian cada mes.

Mi conclusión práctica: para quien quiera una sola máquina portátil que ejecute con fluidez la clase de 27-32 mil millones de parámetros a diario, esta configuración es una elección sólida. Quienes planeen ejecutar en producción modelos densos de 70B o más, quienes hayan quedado fuera por la subida de precios de memoria o quienes permanezcan en un escritorio encontrarán más sensatas las opciones de escritorio de 128 GB o esperar al M6. Para quien quiera que sus datos permanezcan en el dispositivo, este vídeo ofrece una hoja de ruta real.

Fuentes

5 enlaces; ninguna otra noticia publicada los cita. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

m5 max · ia local · 128 gb

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…