Google Research liberó TimesFM-3, un modelo base de series de tiempo con 330 millones de parámetros que pronostica varias series relacionadas en una sola pasada hacia adelante. Todos los checkpoints de TimesFM hasta la versión 2.5 eran univariados: una serie, su propio historial, nada más.
TimesFM-3 fue preentrenado de forma nativa para pronóstico multivariado sobre más de un billón de puntos temporales, y acepta múltiples objetivos, covariables pasadas y covariables pasado-futuro sin ajuste fino específico por tarea. Entre los modelos base preentrenados obtiene el mejor rango promedio en GIFT-Eval, fev-bench y el TIME leaderboard, tanto en métricas puntuales como probabilísticas.
¿Se puede llevar a producción?
Parcialmente. El código del repositorio de TimesFM es Apache-2.0, pero los pesos de TimesFM 3.0 salen bajo la licencia timesfm-non-commercial-license-v1.0, restringida a uso no comercial y fuera de producción. Se puede evaluar hoy mismo, pero no se puede desplegar detrás de una API de pronóstico en producción.
Para equipos de la región, esa distinción es la que decide si el modelo sirve o no. Un retailer chileno que quiera proyectar demanda por local y por SKU puede usar TimesFM-3 para comparar contra su modelo actual, pero si quiere ponerlo a correr en su operación tiene que quedarse en TimesFM 2.5, que sigue siendo la opción Apache-2.0.
¿Qué cambió respecto de la versión anterior?
Cada entrega de TimesFM hasta la 2.5 era univariada: pronosticaba una serie a partir de su propio historial. La mayoría de los problemas reales de pronóstico no tienen esa forma. El ejemplo que usa Google es la venta de helados, donde las ventas de productos relacionados, el flujo de gente, el clima, las promociones y los feriados mueven todos el objetivo.
Tres tipos de entrada funcionan sin ajuste fino específico por tarea:
- Múltiples objetivos, pronosticados en conjunto, con salidas puntuales y por cuantiles para cada uno.
- Covariables pasadas, conocidas solo históricamente, como el flujo de gente de días previos.
- Covariables pasado-futuro, cuyos valores futuros sí se conocen, como un calendario de promociones.
| TimesFM 2.5 | TimesFM-3 | |
|---|---|---|
| Modo | Univariado | Multivariado nativo |
| Parámetros | Serie individual | 330 millones |
| Preentrenamiento | Series propias | Más de 1 billón de puntos |
| Decodificación | Un parche por vez | Horizonte completo en una pasada |
| Licencia de pesos | Apache-2.0 | No comercial, sin producción |
Parches primero, después dos tipos de atención
La arquitectura base sigue siendo un transformer solo de decodificación. Los puntos contiguos se agrupan en parches de 32 pasos y luego se normalizan por serie, para que escalas muy distintas no terminen dominando. Los tokens de objetivo y de covariables pasadas salen de un solo parche. Los tokens de covariables pasado-futuro usan un truco de anticipación: el parche actual se concatena con parches futuros, así el modelo ve los eventos programados antes de que ocurran.
Los tokens entran después a una grilla de dos dimensiones y pasan por dos mecanismos de atención alternados:
- Atención temporal causal, que corre en horizontal. Es estrictamente causal y se limita a los tokens anteriores dentro de la misma serie, lo que bloquea las filtraciones de información.
- Atención completa entre variables, que corre en vertical. En un paso de tiempo dado, un token lee todas las demás series en ese mismo paso y aprende las correlaciones cruzadas.
Una sola pasada en lugar de muchas
Las versiones anteriores de TimesFM decodificaban un parche a la vez. Eso agrega latencia, costo de cómputo y error acumulado. TimesFM-3 usa Contiguous Patch Masking, la estrategia de enmascaramiento en entrenamiento que se introdujo con TiRex.
Se agregan tokens de relleno enmascarados para todo el horizonte. Ahí se enmascaran los objetivos y las covariables pasadas, mientras que las covariables pasado-futuro quedan visibles, de modo que las señales futuras conocidas siguen llegando al modelo. Las capas de atención alternada completan simultáneamente cada parche enmascarado del horizonte. Cada objetivo recibe 9 cuantiles, del percentil 10 al 90, en cada paso del horizonte.
¿Cómo le fue en los benchmarks?
Google evaluó el modelo en GIFT-Eval, fev-bench y el TIME leaderboard, midiéndolo contra Chronos-2, la familia Toto 2.0 y TimesFM-2.5. Entre los modelos base preentrenados, TimesFM-3 obtiene el mejor rango promedio en los tres, tanto en métricas puntuales como probabilísticas.
Las notas de la versión del paquete registran el primer lugar general en fev-bench sobre 100 tareas del mundo real, el primer lugar general en TIME sobre 50 conjuntos de datos de dominio y 98 tareas de evaluación, y el primer lugar entre modelos base en GIFT-Eval.
Puntos clave
- TimesFM-3 es un modelo base de series de tiempo de 330 millones de parámetros, multivariado de forma nativa y preentrenado sobre más de un billón de puntos temporales.
- La alternancia entre atención temporal causal y atención completa entre variables le permite modelar dependencias cruzadas entre series sin entrenamiento adicional.
- Contiguous Patch Masking produce el horizonte completo en una sola pasada, con 9 cuantiles por paso.
- Los pesos son solo para uso no comercial y fuera de producción. TimesFM 2.5 sigue siendo la alternativa Apache-2.0 para desplegar.




