Google ha lanzado TimesFM-3, un modelo que, según la empresa, pronostica tus ventas, tu inventario y tus ingresos sin entrenarse jamás con tus datos. La afirmación es audaz: la tabla del próximo mes con cero entrenamiento sobre tus propios registros. El vídeo pone a prueba esa afirmación con datos de ventas diarias de una empresa de helados.
TimesFM no es un modelo de lenguaje sino un modelo fundacional para series temporales. La lógica es familiar: donde Gemini adivina la siguiente palabra a partir de media frase, TimesFM mira un gráfico que nunca ha visto y dibuja lo que viene después. La primera versión llegó en 2024, alimentada con 100 mil millones de puntos temporales: búsquedas de tendencias, páginas vistas, tráfico, clima, ventas y datos sintéticos.
La nueva versión escala dos cosas: 330 millones de parámetros y un corpus de entrenamiento que supera el billón de puntos. La verdadera ruptura es el alcance: las versiones anteriores leían una sola señal, mientras que TimesFM-3 usa conjuntamente las ventas de productos relacionados, el tráfico histórico en tienda e información futura conocida, como previsiones meteorológicas, días festivos y promociones planificadas.
Para llevar el modelo hasta el límite, el presentador escribió su propia aplicación: 156 días de historial de ventas de helados, los primeros 128 días como contexto y los últimos 28 como horizonte de pronóstico. Las columnas contienen las bolas vendidas, las ventas de conos y jarabes, un indicador de promoción, la temperatura y el tráfico de la tienda. Las puntuaciones se registran con MAPE, MAE y WAPE, y se calcula el delta de ingresos de cada función adicional.
Con las señales de promoción, clima y tráfico desactivadas, el modelo se estabiliza alrededor de 4,6 a 4,7 MAPE. El gráfico se ve decente pero pierde los picos pronunciados de las promociones de mango. Las ventas pasadas por sí solas no pueden explicar las semanas de campaña.
Activar la señal de promoción cambia el panorama: el modelo capta los picos de campaña, el MAPE baja visiblemente y la contribución de las promociones a los ingresos sale a la luz. Añadir clima y tráfico mueve de nuevo el pronóstico, y el presentador señala cómo el frío de septiembre-octubre deprime las ventas de helados. Las señales combinadas claramente superan a cualquiera de ellas por separado.
En el enfrentamiento directo, TimesFM en cero-shot obtiene 4,73 MAPE mientras que Holt-Winters se queda en 8,89 y el método ingenuo estacional en 6,72. Las brechas son claras: 4,16 puntos mejor que Holt-Winters, 1,99 mejor que el ingenuo. Y un solo pronóstico llega en 203 milisegundos, con cero entrenamiento.
El interior de la caja tiene su propio recorrido: en lugar de leer día a día, el modelo comprime 128 días en cuatro bloques de 32 días con una técnica llamada continuous patching. La analogía funciona: leer frase por frase en lugar de letra por letra. Las fluctuaciones diarias ruidosas se filtran, la tendencia general pasa al primer plano, y de ahí viene la velocidad.
La arquitectura funciona con atención bidireccional: primero cada fila estudia solo su propio pasado, matemáticamente impedida de mirar hacia adelante, y así se aprende la línea base orgánica. Luego la atención gira hacia abajo por la columna: con las ventas de septiembre aún vacías, el descuento promocional planificado y la previsión del clima fluyen hacia arriba desde la misma columna y elevan el pronóstico. El ciclo se repite veinte veces a través de la pila de transformadores — el presentador lo compara con un planificador que lee gráficos pasados y luego echa un vistazo al calendario de campañas sobre el escritorio.
El veredicto se mantiene equilibrado: para una empresa sin equipo de pronósticos, esto es más que una actualización — es la diferencia entre tener pronósticos y no tenerlos. Pero donde medio punto de error cuesta millones, los grandes minoristas seguirán entrenando modelos a medida, porque las restricciones de suministro, la canibalización de productos y la estrategia de precios permanecen invisibles para este modelo. Notas prácticas: el código está en GitHub, los pesos se distribuyen bajo una licencia no comercial, y la vía comercial pasa por la integración con BigQuery.
Comentario de la IA
""Puse a prueba la afirmación de cero-shot para que no tengas que hacerlo: el núcleo se sostiene, los extras de escaparate dependen de tus datos. Mi regla es simple — establece primero la línea base con TimesFM y dedica a tu equipo solo donde supere esa línea.""
Evaluación de la IA
La objeción más fuerte primero, en su forma más generosa: este duelo se ejecutó sobre un solo conjunto de datos de helados, en una sola ventana de pronóstico, dentro de la aplicación del propio presentador. Una prueba independiente con ventanas móviles y más de veinte mil pronósticos confirma la afirmación de cero-shot — sin embargo, con los datos de ese probador, los nuevos extras multivariantes no hicieron ninguna diferencia. Así que el núcleo es sólido y las funciones de escaparate dependen de los datos.
Lo que el vídeo deja sin probar es una lista larga: las restricciones de suministro, los productos que se canibalizan entre sí y las decisiones de precios nunca entran en el modelo. La suerte de la ventana única también importa — en la prueba independiente, desplazar la ventana movía las puntuaciones clásicas un diez por ciento. El coste a gran escala, los presupuestos de latencia y la calibración de las salidas probabilísticas quedan todos abiertos.
En cuanto a la verificación hay dos capas: el código es Apache-2.0, pero los pesos están limitados a uso no comercial, y la vía comercial pasa por la plataforma de datos de Google. Tanto el MAPE de la demo como la contribución de las promociones a los ingresos merecen una repetición independiente con tus propios datos antes de entrar en una reunión de decisión.
Mi conclusión práctica: para un negocio que no puede costear un equipo de pronósticos, este modelo es una línea base instantánea; para un equipo que ya está en BigQuery, es un pronóstico en unas pocas líneas de SQL. Pero donde medio punto de error se traduce en millones, el entrenamiento a medida sigue siendo obligatorio. Yo establecería primero la línea base con este modelo y luego dedicaría el tiempo del equipo solo al trabajo que lo supere.
Fuentes
7 enlaces; 2 de ellos también citados por 1 otra noticia. Stories sharing a link do not confirm each other; a source's origin is not inferred from how often it is cited.
- @youtube https://www.youtube.com/watch?v=_tB4pdy9VJw
- @research https://research.google/blog/timesfm-3-a-zero-shot-foundation-model-for-multivariate-forecasting/
También citado por: Top 10 Trending GitHub Repos: From Archify to Omarchy and TimesFM — Visual Code to Agentic Linux
- @github https://github.com/google-research/timesfm
También citado por: Top 10 Trending GitHub Repos: From Archify to Omarchy and TimesFM — Visual Code to Agentic Linux
- @cloud https://cloud.google.com/blog/products/data-analytics/timesfm-models-in-bigquery-and-alloydb
- @docs https://docs.cloud.google.com/bigquery/docs/timesfm-model
- @dev https://dev.to/han-co/i-tested-googles-timesfm-3-the-zero-shot-claim-holds-the-new-features-dont-4ol4
- @andrew https://andrew.ooo/posts/timesfm-google-time-series-foundation-model-review/
timesfm · pronosticos · google · ia · series temporales · bigquery