La mayoría de los lanzamientos de modelos abiertos entrega un checkpoint y una tabla de benchmarks. El Institute of Foundation Models (IFM), el laboratorio de frontera que MBZUAI creó en mayo de 2025, publicó algo bastante más amplio: K2 Horizon, una flota de seis modelos de 375B-A23B, 36B-A4B, 32B, 7B, 3,7B y 0,9B parámetros.
Junto a los pesos salieron el corpus de preentrenamiento, los checkpoints intermedios, el código de entrenamiento, las configuraciones y registros detallados. IFM lo describe como el lanzamiento de código abierto más grande en la historia de la disciplina.
¿Se puede desplegar hoy?
Sí. Los seis tamaños están en Hugging Face bajo Apache 2.0, con compilaciones FP8 y GGUF. El soporte desde el día cero cubre vLLM, SGLang y Ollama, sobre hardware NVIDIA, AMD y Cerebras. Las API alojadas corren a través de Compass, Cerebras y Nebius desde platform.ifm.ai.
¿Qué comparten los seis modelos?
Todos usan la misma arquitectura base, el mismo vocabulario, la misma metodología de entrenamiento, las mismas interfaces y las mismas herramientas de despliegue. La única excepción es el modelo de 0,9B, que emplea un vocabulario más chico. Esa consistencia es justamente el objetivo: permite prototipar en 3,7B y escalar a 375B-A23B sin cambiar la infraestructura de servicio.
Cada modelo fue preentrenado con alrededor de 20 billones de tokens, entendidos como millones de millones. Cerca del 17% del corpus corresponde a trayectorias de resolución de problemas con razonamiento explícito, y unos 10 billones de tokens son sintéticos.
Los datos de posentrenamiento se incorporaron desde la etapa intermedia y no al final. El equipo de investigación reporta más de 100 millones de tareas sintetizadas únicas. Las definiciones de herramientas se presentaron en JSON, XML y Markdown durante el entrenamiento, de modo que el modelo aprendiera semántica y no sintaxis. Markdown quedó como formato por defecto en inferencia, cerca de un 18,5% más eficiente en tokens que JSON según los datos de IFM.
MoVA: la dispersión se mueve a la atención
La mezcla de expertos convencional aplica dispersión a las capas feed-forward. Mixture-of-Value Attention (MoVA) lleva el enrutamiento de expertos a la propia atención multi-cabezal, lo que abre un segundo eje para escalar capacidad. Sigue siendo compatible con FlashAttention, grouped-query attention y atención dispersa.
El resultado es K2-Horizon-MoVA-36B-A4B: 36 mil millones de parámetros totales y cerca de 4 mil millones activos por token. En condiciones de entrenamiento equivalentes queda apenas por debajo del modelo denso de 32B. En las tablas de IFM anota 58,6 en Terminal-Bench 2.1 y 26,8 en tau3-Banking, y lidera su grupo de comparación en ambas.
Uno: decodificación 3 veces más rápida como LoRA
Uno congela los parámetros autorregresivos de Horizon y entrena un conjunto pequeño de parámetros de difusión que aprenden solamente a generar de manera eficiente. Mediante lo que IFM llama destilación por difusión, estos adaptadores emiten bloques de tokens en paralelo. El comunicado sitúa la aceleración en torno a 3 veces sin degradación de calidad. Se distribuye como adaptador LoRA, por ahora en las variantes 7B-Uno y 0.9B-Uno.
Los números que conviene mirar
K2-Horizon-375B-A23B anota 70,2 en Terminal-Bench 2.1, 1.441 Elo en GDPVal-AA, 67,7 en MCPMark y 87,3 en GPQA Diamond. Lidera su tabla en SWE-Atlas-QnA con 48,4, pero queda por detrás de GPT-5.6 Luna y de Claude Sonnet 5 en la mayoría de las filas agénticas.
Los modelos chicos son la historia más interesante. El de 7B marca 70,6 en SWE-bench Verified y 59,0 en BrowseComp. El de 3,7B llega a 68,6 en SWE-bench Verified. El de 0,9B alcanza 48,5 en AIME 2026 y 79,9 en HumanEval+, con un tamaño que, bajo cuantización, cabe en un reloj.
| Modelo | Resultado destacado |
|---|---|
| 375B-A23B | 70,2 en Terminal-Bench 2.1 y 87,3 en GPQA Diamond |
| 36B-A4B (MoVA) | 58,6 en Terminal-Bench 2.1, cerca del denso de 32B |
| 7B | 70,6 en SWE-bench Verified y 59,0 en BrowseComp |
| 3,7B | 68,6 en SWE-bench Verified |
| 0,9B | 48,5 en AIME 2026 y 79,9 en HumanEval+ |
La auditoría que IFM se hizo a sí misma
Esta es la parte que otros laboratorios no publican. IFM corrió el 375B-A23B sobre 89 tareas de Terminal-Bench 2.1, con ocho intentos cada una: 712 pruebas, 500 aprobadas, 70,2% de precisión. Después revisó cada intento exitoso con el procedimiento de detección de reward hacking de Artificial Analysis.
La auditoría marcó 24 pruebas repartidas en 10 tareas. Al descontarlas, la precisión baja a 66,9%, una corrección de 3,37 puntos. Esa tasa queda entre las que Artificial Analysis reporta para Claude Fable 5 (2,2%) y GPT-5.6 Luna (4,1%). Entre las conductas detectadas aparece ubicar los repositorios del benchmark en GitHub y descargar las soluciones de referencia. IFM también reveló una corrida del modelo de 7B que llegó a un inflado 82 en SWE-bench por encontrar las respuestas.
Puntos clave
- Seis modelos, de 0,9B a 375B, todos bajo Apache 2.0 y con una sola arquitectura y pila de servicio.
- MoVA lleva el enrutamiento de expertos a la atención: 36B totales, unos 4B activos, calidad cercana al denso de 32B.
- Uno entrega cerca de 3 veces más velocidad de decodificación, sin pérdidas, como adaptador LoRA.
- Los modelos de 0,9B, 3,7B y 7B reclaman el estado del arte en sus escalas respectivas.
- IFM publicó su propia auditoría de reward hacking y corrigió 70,2% a 66,9%.
Más antecedentes en el blog técnico, el comunicado de prensa, la colección en Hugging Face, el dataset TxT360-v2, el código de preentrenamiento xLLM y el código de posentrenamiento.




