La consolidación fue uno de los caminos que muchos observadores agudos predijeron para el futuro cercano de los laboratorios que entrenan modelos. Se la calificó de inevitable, dado que los costos de entrenamiento crecen en órdenes de magnitud cada año. Y sin embargo, escribe el autor del recuento, alguien que en 2024 habría situado esa consolidación en 2026 o 2027 tiene que constatar dónde estamos parados: más empresas están entrenando modelos potentes, invirtiendo con facilidad entre cientos de millones y miles de millones de dólares en el esfuerzo total, y un número creciente de organizaciones los está liberando de forma abierta.

La demanda de tokens es altísima y probablemente siga subiendo a medida que los modelos se vuelvan más eficientes y habiliten más casos de uso. Todos esos laboratorios que suponíamos condenados a fusionarse están descubriendo que construir máquinas de tokens es un camino plausible hacia el valor.

El ejemplo principal es Thinking Machines. Cuando anunciaron la empresa en febrero de 2025, muy poca gente los habría puesto en la categoría de compañía de modelos abiertos. Hoy su servicio de ajuste fino sobre modelos abiertos factura cientos de millones de dólares al año y están publicando los mejores modelos de pesos abiertos construidos en Estados Unidos, por delante de los primeros líderes: NVIDIA con Nemotron y Arcee con Trilogy.

Del otro lado del ecosistema está el ritmo sostenido de los laboratorios chinos, con nuevos entrantes como Xiaomi todavía acumulando presencia en la economía general de la IA. Tras haber pronosticado consolidación durante tanto tiempo, la apuesta más segura ahora parece ser predecir adopción continuada e intentar imaginar el rol que juegan ahí los modelos abiertos. ¿Cuánto pueden sostenerse las licencias con reparto de ingresos como la de Kimi K3? ¿Cuánta participación de mercado pueden tomar los modelos abiertos?

¿Cuáles son los lanzamientos destacados?

  • Inkling de thinkingmachines: el primer modelo de la empresa es un MoE multimodal de 975B-A41B que acepta texto, imágenes y audio como entrada y produce texto. No es el más potente entre sus pares de la misma clase de tamaño en China, pero está posicionado como una gran base para ajuste fino, por ejemplo a través de su oferta comercial Tinker. También publicaron una versión más chica de 276B-A12B, muy competitiva para su tamaño.
  • Hy3 de tencent: un MoE de 295B-A21B que mejora a su antecesor en todas las métricas. Lo más notable, sin embargo, es el cambio de licencia: donde la versión previa usaba una licencia propia bastante restrictiva, Tencent pasó a Apache 2 para este lanzamiento. El modelo además logró demostrar un problema matemático de 50 años, con un arnés dedicado y Sol como juez, aunque no queda claro qué tan determinante fue esto último.
  • Laguna-S-2.1 de poolside: poolside pasó de la nada a ser invitado frecuente del recuento, con su tercera aparición en tres meses consecutivos. S2.1 es una versión reentrenada, en pre y post entrenamiento, del MoE de 118B-A8B que cabe en un DGX Spark, lo que le trajo mucha atención. La empresa adoptó además la licencia OpenMDW, similar a Apache 2.0 pero con mejor respaldo legal específico para modelos de IA, y entrega detalles adicionales en su blog, incluidas todas las trayectorias de evaluación. Es un nivel de transparencia poco habitual.
  • DeepSeek-V4-Flash-0731 de deepseek-ai: apenas un día después de que OpenAI bajara en 80% el precio de su modelo más chico, llegó esta actualización que supera a Luna en la frontera de Pareto. El modelo grande todavía no se actualiza, así que queda por verse dónde aterriza en rendimiento.
  • Kimi-K3 de moonshotai: el lanzamiento abierto más grande en bastante tiempo. Salió bajo una licencia no comercial que obliga a los proveedores de inferencia y de ajuste fino a firmar un acuerdo comercial.

Sobre este último punto, Kevin Xu y Graham Webster argumentan que estas licencias habilitan una eventual acción gubernamental contra entidades estadounidenses que hagan negocios con empresas chinas de IA.

"Pero si una empresa estadounidense necesita un contrato con Moonshot para proveer los tokens de inferencia que genera Kimi K3, el panorama cambia. Algunas de las herramientas de política que funcionarios estadounidenses y otros han debatido como palancas potenciales para restringir el uso de modelos abiertos chinos aplicarían con mayor claridad", escriben.

¿Qué más apareció en la categoría de propósito general?

ModeloOrganizaciónTamañoDato distintivo
LongCat-2.0meituan-longcat1,6T parámetrosEntrenado íntegramente en Ascend 910
Motif-3-BetaMotif Technologies314B-A13BInnovaciones arquitectónicas GDLA y mHC
Apertus-v1.5-70Bswiss-ai70B2T tokens adicionales de preentrenamiento
Instella-MoE-16BAMD16B-A3BEntrenado en tarjetas Instinct, checkpoints completos
Laguna-XS-2.1poolside33B-A3BActualización de la variante chica
  • LongCat-2.0 de meituan-longcat: el DoorDash chino vuelve a la carga, esta vez con otro MoE grande de 1,6 billones de parámetros. Si bien el modelo no es el más capaz para su tamaño más allá de los benchmarks, fue entrenado enteramente en aceleradores Ascend 910, lo que lo convierte en el primer modelo serio ajeno a Huawei entrenado por completo en chips chinos. Los demás chips chinos se usan mayoritariamente para inferencia, cuando se usan.
  • Laguna-XS-2.1 de poolside: una actualización del MoE chico de 33B-A3B.
  • Motif-3-Beta de Motif-Technologies: un adelanto del MoE de 314B-A13B de la coreana Motif. Es por lejos el modelo más ambicioso de la empresa, considerablemente más grande e incorporando innovaciones arquitectónicas como GDLA y mHC.
  • Apertus-v1.5-70B de swiss-ai: un preentrenamiento continuado del Apertus 1.0 completamente abierto, con 2 billones de tokens adicionales.
  • Instella-MoE-16B-A3B-Think de amd: un MoE de 16B-A3B entrenado por AMD sobre tarjetas Instinct. La empresa además publica todas las etapas intermedias, desde el modelo base y los checkpoints SFT hasta MidTrain y DPO.

Es uno de los recuentos de modelos abiertos más cargados que ha tenido la publicación.