Z.ai publicó GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5 y el modelo de programación capaz más barato que ha lanzado el laboratorio. Es un modelo de mezcla de expertos con 320.000 millones de parámetros totales y 18.000 millones activos por token, una ventana de contexto de 1.048.576 tokens y entrada de imagen y video, liberado bajo licencia MIT con los pesos disponibles en Hugging Face. Según los reportes de Z.ai, supera a GLM-5.2 en benchmarks y en cargas reales a aproximadamente una décima parte del precio, y queda a menos de medio punto de Claude Opus 4.8 en su benchmark interno de programación. El modelo pasó su primera semana funcionando de forma anónima bajo el nombre Ox Alpha en OpenCode y OpenRouter, servido íntegramente sobre chips de IA fabricados en China.

¿Se puede desplegar hoy?

Sí, por dos vías. Los pesos están publicados en Hugging Face bajo licencia MIT, y ya existe una API alojada con precios definidos y en operación.

  • ¿Qué empresas pueden alojarlo por su cuenta? No cualquiera. El checkpoint por defecto en FP8 pesa alrededor de 306 GiB solo en pesos, antes de la caché KV, y la ruta actual de vLLM soporta únicamente NVIDIA Hopper o posterior. Eso deja el autoalojamiento al alcance de organizaciones medianas y grandes con al menos un nodo de 8 GPU, o una bandeja GB200 con TP4, más las startups nativas de IA que arriendan capacidad. Todo el que quede bajo esa línea lo consume como API, donde el relato son las economías y no el hardware.
  • Industrias con encaje inmediato: software y herramientas de desarrollo, automatización de TI y BPO, operaciones documentales en servicios financieros y seguros, inteligencia de negocios y trabajo administrativo, comercio electrónico y cualquier equipo que produzca interfaces a gran volumen.
  • Aplicaciones: agentes de programación a escala de repositorio, agentes de terminal y de uso de navegador, análisis de registros y contratos de un millón de tokens, verificación de regresiones visuales a partir de capturas de pantalla, y razonamiento sobre planillas, presentaciones y tableros que de otro modo necesitaría una cadena de OCR a texto.

¿De dónde viene la eficiencia del modelo?

GLM-5.3-Flash parte de un modelo base entrenado desde cero sobre un corpus multimodal de 30 billones de tokens. Tres cambios vale la pena conocer:

  • Atención híbrida: por primera vez en la serie GLM, Z.ai combina atención lineal y dispersa. Según la receta de vLLM, el modelo de lenguaje de 45 capas intercala capas de atención lineal KDA con capas dispersas MLA sin codificación posicional, enruta cada token a través de 8 de 288 expertos y entrega pesos nativos en FP8 más una capa de borrador MTP. La atención lineal se hace cargo de la dependencia local y la dispersa recupera el contexto globalmente relevante.
  • IndexPool: con contexto de un millón de tokens, la recuperación misma se vuelve el cuello de botella. IndexPool comprime grupos de vectores clave del indexador mediante agrupamiento ponderado para contener la latencia y la memoria. Z.ai reporta cerca de 3 veces menos cómputo de atención y una caché KV 4,4 veces más pequeña frente a GLM-5.3.
  • mHC: el modelo adopta hiperconexiones restringidas a variedades (Manifold-Constrained Hyper-Connections) para mejorar la eficiencia de escalado. Contra GLM-4.5, con un recuento total de parámetros similar, GLM-5.3-Flash reduce aproximadamente a la mitad tanto los parámetros activados como el número de capas.

Benchmarks

La mayoría de las cifras que reporta el laboratorio provienen del propio Z.ai y los arneses de prueba difieren según el test. Las notas al pie de la ficha del modelo especifican temperatura, límites de contexto y modelos jueces por benchmark, así que conviene tratar las comparaciones entre modelos como dependientes de la configuración.

De forma independiente, Artificial Analysis le asigna 57 puntos en su índice de inteligencia, con 48,7 tokens de salida por segundo y 1,52 segundos de tiempo hasta el primer token sobre la API de Z.ai. Buena inteligencia por dólar, pero lento y verboso. La visión es el flanco débil: queda detrás de Gemini 3.7 Flash en BabyVision y MVbench.

MétricaGLM-5.3-Flash
Parámetros totales / activos320.000 M / 18.000 M
Contexto1.048.576 tokens
Terminal-Bench 2.184,3
DeepSWE v1.163,4
Índice de inteligencia (Artificial Analysis)57
LicenciaMIT

El servicio es la parte poco cubierta

Z.ai afirma que toda la vista previa de Ox Alpha corrió sobre chips de IA fabricados en China, usando un motor propio basado en SGLang que desagrega codificación, prefill y decoding, y reporta una mejora de 3 veces en el servicio de punta a punta a lo largo de decenas de miles de aceleradores.

Precios y acceso

El precio estándar de la API es de 0,15 dólares por millón de tokens de entrada, 0,03 por millón de entrada en caché y 0,50 por millón de salida. Z.ai reporta un puntaje de 57 en el índice de inteligencia de Artificial Analysis v4.1.1 a 0,045 dólares por tarea en el nivel con descuento. El modelo está disponible para todos los niveles del GLM Coding Plan, Lite (18 dólares al mes), Pro (80) y Max (168), con el triple de la cuota utilizable de GLM-5.3, y sus capacidades multimodales aparecen en ZCode a través de Browser Use y Computer Use. El servicio local está soportado en SGLang, vLLM, TokenSpeed y KTransformers.

Cuánto cuesta realmente para un equipo en la región

La cifra que ordena la decisión no es el precio por millón de tokens sino el punto de quiebre entre API y hardware propio. Un agente de programación que procese 50 millones de tokens de entrada y 10 millones de salida en un mes paga alrededor de 12,50 dólares en la API estándar, sin considerar el descuento por caché de prefijo. Frente a eso, el nodo de 8 GPU Hopper o superior que exige el autoalojamiento es una inversión de otro orden de magnitud, y ese equipamiento no tiene canal de venta local establecido en Chile: se importa o se arrienda por hora en nube extranjera.

La licencia MIT es lo que cambia el cálculo a mediano plazo. A diferencia de las licencias de uso restringido que acompañan a varios modelos de pesos abiertos, MIT permite uso comercial sin condiciones de atribución ni límites de facturación, así que una empresa regional puede construir producto encima sin negociar términos. El costo de entrada sigue siendo la infraestructura, no el permiso.

Los pesos del modelo están disponibles en Hugging Face y los detalles técnicos en el blog de Z.ai.