Thinking Machines Lab, la empresa fundada por Mira Murati, presentó Inkling, su primer modelo de lenguaje completo y, como bono, con pesos abiertos. La compañía lo posiciona no como un modelo que maximiza benchmarks, sino como una base multimodal sólida y personalizable, disponible desde el primer día en su plataforma Tinker, en Hugging Face y con socios de infraestructura.

Inkling es un transformador de mezcla de expertos (MoE) con 975.000 millones de parámetros totales y 41.000 millones activos por token. Fue entrenado desde cero sobre 45 billones de tokens de texto, imágenes, audio y video, razona de forma nativa sobre esas modalidades y entrega salida en texto. Los pesos abiertos admiten hasta 1 millón de tokens de contexto, mientras que el acceso vía API en Tinker se ofrece con 256.000 tokens.

¿Qué distingue a Inkling de otros modelos abiertos?

El primer punto es la licencia: Inkling se libera bajo Apache 2.0, lo que permite uso comercial sin restricciones de atribución agresivas, algo poco común entre los modelos de este tamaño. El segundo es la familia: junto al modelo principal, la empresa adelantó Inkling-Small, una versión más liviana de 276.000 millones de parámetros totales y 12.000 millones activos, que en varias evaluaciones resultó inesperadamente competitiva frente al modelo grande, con menor costo y latencia.

Mira Murati describió a Inkling como el "primer modelo" de la compañía, "entrenado desde cero", con pesos abiertos y ajuste fino disponible el mismo día en Tinker. John Schulman aportó contexto temporal: el preentrenamiento comenzó el invierno pasado y, desde mediados de enero, un equipo pequeño construyó encima las capacidades de programación, razonamiento y trabajo agéntico.

Comparativa de especificaciones y rendimiento de Inkling
Comparativa de especificaciones y rendimiento de Inkling

¿Qué decisiones de arquitectura llaman la atención?

Lectores técnicos que analizaron el reporte destacaron varias elecciones poco habituales a esta escala:

  • Atención híbrida de ventana deslizante, con una proporción de 5 a 1 entre capas locales y globales y un tamaño de ventana de 512.
  • Codificación posicional relativa en lugar de RoPE, señalada como una de las decisiones más novedosas a gran escala.
  • Capas de convolución corta alrededor de los flujos de atención y FFN, con un uso escalado poco común.
  • MoE con dos expertos compartidos, atípico frente a los diseños recientes que usan uno solo.
  • 8 cabezales MTP para decodificación especulativa, resaltados por el proyecto vLLM.

El experto en optimización Aaron Defazio confirmó que Inkling emplea su enfoque corregido de decaimiento de pesos, apodado "MuonC/AdamC". El lanzamiento llegó además con un soporte de ecosistema inusualmente amplio desde el día cero: vLLM, SGLang, Modal, Baseten, Databricks y Hugging Face, entre otros.

Desglose técnico de Inkling según Hugging Face
Desglose técnico de Inkling según Hugging Face

¿Cómo rinde frente a la competencia?

Artificial Analysis ubicó a Inkling en 41 puntos de su Intelligence Index, con lo que debuta como el modelo de pesos abiertos de EE.UU. más capaz hasta la fecha. Queda por delante de Nemotron 3 Ultra (38), Gemma 4 31B (29) y gpt-oss-120b (24), aunque los comentaristas independientes coincidieron en que todavía se ubica por detrás de los mejores modelos abiertos chinos y de los modelos cerrados líderes en varios benchmarks.

Modelo abiertoIntelligence Index (AA)
Inkling (Thinking Machines)41
Nemotron 3 Ultra38
Gemma 4 31B29
gpt-oss-120b24

Un dato que la firma destacó es la eficiencia de tokens: Inkling promedia 25.000 tokens de salida por tarea del índice, frente a los 43.000 de GLM-5.2 max, 38.000 de Kimi K2.6 y 37.000 de DeepSeek v4 Pro max. En un escenario de despliegue local o edge en la región, donde cada token de salida se traduce en costo de cómputo o de API, esa frugalidad importa tanto como el puntaje bruto.

El equipo insistió en que se trata de un lanzamiento de día uno y una base para futuras iteraciones, no de su apuesta final de frontera. Para la comunidad de código abierto, sin embargo, ya es el punto de partida estadounidense más serio: pesos completos, licencia permisiva y una variante pequeña que promete rendir por encima de su tamaño.