The Information tuvo la primicia y ahora tiene la confirmación: Nvidia está comprando Hugging Face por 13.000 millones de dólares, aproximadamente 80 veces sus 150 millones de dólares de ingresos anuales recurrentes, tras haber duplicado su base de clientes en 2026.
La cifra casi duplica la oferta inicial de 7.000 millones de dólares que Nvidia había puesto sobre la mesa en enero de 2026. El anuncio coincide con la publicación por parte de OpenAI de su informe retrospectivo sobre el incidente de seguridad que afectó a la plataforma.
La operación llega en un contexto favorable para el software de pesos abiertos: GLM-5.3-Flash, conocido durante su vista previa como Ox Alpha, impresionó a la comunidad esta misma semana, y Qwen también despachó un modelo Flash competitivo corriendo sobre chips chinos. La conversación posterior a Hot Chips sobre la IA abierta occidental es el telón de fondo exacto de esta compra.
¿Qué es GLM-5.3-Flash y por qué importa acá?
Z.ai lanzó formalmente GLM-5.3-Flash revelando que el modelo previamente presentado como Ox Alpha es su identidad pública. Las especificaciones oficiales del anuncio:
- 320.000 millones de parámetros totales y 18.000 millones activos
- Ventana de contexto de 1 millón de tokens
- Multimodal nativo
- Licencia MIT
- Pesos distribuidos en Hugging Face, además de API propia, plan de programación e integraciones
La compañía afirma que el modelo corre "íntegramente sobre chips de IA chinos". Sobre su propio banco de pruebas de programación, Z.ai sostiene que GLM-5.3-Flash "supera claramente a GLM-5.2 en todos los niveles de esfuerzo y rinde a la par de Claude Opus 4.8". Al tratarse de una medición de la propia empresa, conviene leerla con más cautela que una evaluación independiente.
¿Cuánto cuesta correrlo frente a la competencia?
La evaluación independiente más sustantiva vino de Artificial Analysis, que le asignó 57 puntos en su índice de inteligencia, tres puntos por debajo de GLM-5.3, que anota 60. Las cifras de costo son las que llamaron la atención:
| Métrica | GLM-5.3-Flash | Referencia |
|---|---|---|
| Índice de inteligencia | 57 | GLM-5.3: 60 |
| Costo por tarea | 0,09 dólares | GLM-5.3 max: 0,68 dólares |
| Precio de entrada | 0,15 dólares por millón de tokens | |
| Precio de salida | 0,50 dólares por millón de tokens | |
| Entrada en caché | cerca de 0,026 a 0,03 dólares por millón | descuento de 80% |
Artificial Analysis calcula que resulta unas 7,5 veces más barato por tarea que GLM-5.3 max, cerca de 5,7 veces más barato que GPT-5.6 Terra y unas 4,4 veces más barato que Muse Spark 1.2, empatando con ambos en 57 puntos de índice.
Hay un matiz importante en la eficiencia de tokens. El modelo consumió 149 millones de tokens de salida para correr el índice, frente a 168 millones de GLM-5.3, pero por encima de Kimi K3 (133 millones) y de Qwen3.8 2.4T A95B (136 millones) con puntaje similar. De esos 149 millones, alrededor de 134 millones, cerca del 90%, fueron tokens de razonamiento. Es decir, la economía del modelo se ve excelente sobre todo porque el precio por token es muy bajo, no porque sea especialmente frugal.
En tareas agénticas rinde mejor de lo que sugieren sus métricas de conocimiento puro: Elo de 1770 en GDPval-AA v2, empatado dentro del margen de error con GLM-5.3 y Grok 4.6, detrás solo de Claude Opus 5; 84,3% en Terminal-Bench v2.1 contra 83,9% de GLM-5.3; y 47,2% en el benchmark bancario, 3,1 puntos porcentuales por debajo de GLM-5.3.
En conocimiento factual la historia cambia: precisión de 28% con una tasa de alucinación de 28%, contra 34% de precisión y 30% de alucinación de GLM-5.3, y 47% de precisión de GPT-5.6 Terra.
¿Qué cambió en la arquitectura?
El desglose técnico más detallado en circulación indica que GLM-5.3-Flash pasa del esqueleto 744B-A40B de GLM-5.2 a 320B-A18B, usando atención híbrida estilo Kimi Linear en proporción 3:1, con 34 capas KDA (Kimi Delta Attention) y 11 capas MLA/DSA, camino residual mHC al estilo DeepSeek V4, cuatro flujos paralelos y un codificador de visión nativo. Se lo describe como "súper híbrido" porque ambos componentes principales de atención ya son variantes eficientes, en vez de mezclar atención eficiente con atención completa.
Un resumen orientado a sistemas plantea el lanzamiento como una historia de eficiencia: cerca de una décima parte del costo respecto de GLM-5.2, parámetros activos que bajan de 32.000 a 18.000 millones, capas que caen de 92 a 45, atención lineal y dispersa combinadas, y una caché KV promedio más pequeña por capa cuyo efecto se acumula en contextos largos.
El ángulo de los chips chinos
El lado de hardware fue una de las partes más comentadas. SemiAnalysis se enfocó en la afirmación de que se están sirviendo 100 billones de tokens al día sobre chips chinos, y encuadró la hazaña de infraestructura como lo más sorprendente de la revelación. Un cálculo de servilleta que circuló en la discusión estima que, si la economía de inferencia es comparable a la de V4-Flash, con 10.000 tokens por segundo por NPU se llega a unos 864 millones de tokens diarios por chip, de modo que ese volumen implicaría alrededor de 116.000 chips.
Hubo también reparos independientes: al menos un analista argumentó que el modelo se ve débil en varias tareas de visión y detección de objetos pese a ser "de visión nativa". Y Artificial Analysis publicó primero una ficha con una ventana de contexto errónea de 400.000 tokens, que luego corrigió a 1 millón, alineándose con el anuncio original de Z.ai.




