Volver al inicio

Todos los caminos llevan de vuelta a GLM: GLM-5.3 y el nivel Flash que se quedó

Tras un mes de recorrido por el nivel de modelos Flash, sentdex regresa a su favorito: el GLM-5.3-Flash de Z.ai, de 320 mil millones de parámetros, nativamente multimodal y con licencia MIT. Velocidad local, puntuaciones de agentes, una disputa sobre un benchmark de visión y una demo robótica protagonizan este vídeo.

Importado a Nodesdaily: (UTC+03:00)
Ver en YouTube — PJBZmCy1Hfg
Opciones de lectura

La voz del dispositivo no está disponible en este navegador.

Lupa de conceptos

Elige un término técnico de esta vista para leer su definición general, un ejemplo didáctico y su uso en el artículo.

No se encontró ningún término de nuestro glosario en esta vista. El glosario aún no cubre todos los términos.

El vídeo abre con una afirmación audaz: todos los caminos llevan de vuelta a GLM. El anfitrión dice que cambió el título de su vídeo anterior por el lanzamiento de DeepSeek V4 Flash y el revuelo del harness OMP, y ahora el título ha vuelto. Así, este vídeo se lee como un balance de aproximadamente un mes recorriendo el nivel Flash de modelos.

Dos lanzamientos están sobre la mesa: GLM-5.3 (el modelo completo) y GLM-5.3-Flash, ambos publicados el 26 de agosto de 2026. Flash es un MoE de 320 mil millones de parámetros con unos 18 mil millones activos por token. Un diseño de atención híbrida lineal más dispersa, entrenamiento nativamente multimodal, una licencia MIT y una ventana de contexto de un millón de tokens completan el paquete. El modelo había estado circulando de incógnito como ox-alpha en OpenCode y OpenRouter durante aproximadamente una semana antes de la revelación.

El precio es la savia de la historia: Flash cuesta 0,075 $ por millón de tokens de entrada y 0,25 $ por millón de tokens de salida, con entrada en caché alrededor de 0,011 $. Eso es aproximadamente una décima parte de la banda de 1,4 $/4,4 $ comentada para el modelo completo. La tesis del vídeo se anuda aquí: para los equipos que ejecutan cargas de trabajo de agentes todo el día, esta partida decide la economía.

En cuanto a la inferencia local, las cifras reportadas en el vídeo son las siguientes: Flash alcanza unos 170 a 180 tokens por segundo en precisión nativa (pesos FP8, torre de visión BF16), mientras que DeepSeek V2 Flash se cita cerca de 350 y GLM-5.2 en 3,25 bits cerca de 100 tokens por segundo. La GPU del anfitrión está muerta y a la espera de reemplazo, así que estos números deben leerse como las mediciones propias del vídeo; las pruebas frescas del lado de la API se omiten deliberadamente.

Las puntuaciones de agentes provienen de Terminal-Bench 2.1: 0,9 minutos para fallar, 3,2 minutos para resolver. La lectura del anfitrión rompe el molde: cuando un humano está en el bucle, fallar rápido es una bendición, ya que das tu entrada y vuelves al trabajo. La velocidad de resolución va por detrás de DeepSeek V4 Flash pero aproximadamente duplica a GLM-5.2, con la salvedad de que las elecciones de harness como OMP mueven los números.

La sección más acalorada es la disputa de visión: tras publicaciones vinculadas a un ranking de detección de objetos del lado de Roboflow que daba a GLM-5.3 una puntuación baja, el anfitrión construye su propia prueba. En la tarea de marcar cada bananero en una foto aérea de una granja, su intento sale mucho mejor que la puntuación compartida. Señala abiertamente que su material de prueba se limita a un solo fotograma, así que ni una puntuación ni un fotograma deberían bastar para un juicio definitivo.

Sigue una lección general: los detectores de objetos clásicos son construcciones de una sola tarea, y cualquier cambio de tarea implica reentrenar o reconstruir la escena de simulación desde cero. El anfitrión usa la palabra general con modestia deliberada; la afirmación no es inteligencia artificial general sino una herramienta ampliamente útil, como un modelo de lenguaje que genera texto. Por eso también importa la visión: al diseñar una página web, un PDF o una presentación, un modelo que trabaja con lo que ve marca la diferencia.

La demo robótica es la puerta del vídeo al mundo físico: GLM-5.3 Flash se conecta al SDK del robot, combinando avanzar, rotar, movimientos hombro-codo-pinza y acceso a la cámara en un solo modelo. En la grabación, el modelo afina su aproximación con sus ruedas cerca del bloque, y luego completa una tarea de recoger cosas del suelo. Destaca la nota del anfitrión: la configuración fue sorprendentemente fácil, y se puede llevar más lejos.

El cierre trae notas del ecosistema: según el informe de CNBC del 3 de septiembre de 2026, Nvidia compra Hugging Face por casi 13 mil millones de dólares, cambiando de manos el canal de distribución de modelos de pesos abiertos. Se rumorea un nuevo modelo Qwen en el horizonte, mientras que el estado de licencia del movimiento Muse de Meta sigue sin claridad incluso en el vídeo. El veredicto del anfitrión es nítido: GLM-5.3 Flash es el modelo de uso diario por ahora, con pruebas más profundas cuando vuelva el hardware.

Visualization: nodesdaily AI

Comentario de la IA

""Mi lectura: el nivel Flash ya no es un compromiso, es la opción por defecto para la mayoría del trabajo. Este vídeo muestra por qué, punto por punto.""

Evaluación de la IA

Para defender al lado del ranking: un solo fotograma de una bananera no exculpa a un modelo; los conjuntos de prueba estándar existen precisamente por esta razón, y el experimento del anfitrión se limita a la única imagen que pudo encontrar. Tomo esa objeción en serio, pero también vale lo inverso: si las imágenes brutas de la prueba no son públicas, el ranking no puede auditarse desde fuera, y una única puntuación baja puede marcar el punto ciego de la prueba más que el veredicto sobre el modelo.

Dos frentes quedan sin probar en el vídeo. Primero, el trabajo desordenado en repositorios reales con contexto disperso: las tareas cortas de agentes y las pruebas de un solo fotograma no representan trabajos de producción multiarchivo, que suele ser donde los modelos de pago se adelantan. Segundo, la dimensión de seguridad: entregar a un modelo autoridad sobre un terminal y hardware robótico carga sobre el usuario la auditoría de cada comando que ejecuta, y el vídeo nunca aborda esa responsabilidad.

Las cifras provienen de orígenes mixtos, así que las dividí en dos: la banda de precios se verifica en páginas de precios independientes, pero las velocidades locales y las duraciones de Terminal-Bench son mediciones propias del vídeo; el hardware y las elecciones de harness las mueven, y querría una medición independiente antes de decidir. Mi conclusión: Flash es una opción real para los manitas que quieren visión y código en un solo modelo y les importa mantener los datos en el dispositivo, pero no para confiar secretos de producción a endpoints gratuitos limitados por cuota.

Fuentes

7 enlaces; 2 de ellos también citados por 2 otras noticias. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.

glm-5.3-flash · z.ai · economía de agentes

Seguir el tema

Antes de esta noticia

Un breve orden de lectura de noticias anteriores vinculadas a este evento por un editor.

Evidencia y fuentes

Revisa los pasajes permitidos, sus versiones y su origen.

KAYNAKLARLA OKU

Bu haberi açalım.

Hesap kontrol ediliyor…