Moonshot AI presentó Kimi K3, bautizado por la empresa como "Open Frontier Intelligence", en lo que describe como el mayor modelo de pesos abiertos liberado hasta la fecha. El modelo ya está operativo en Kimi.com, Kimi Work, Kimi Code y su API, mientras que los pesos abiertos quedaron prometidos para el 27 de julio de 2026.
Las especificaciones oficiales son contundentes: 2,8 billones de parámetros totales, ventana de contexto de 1 millón de tokens y entrada multimodal nativa que combina texto e imágenes, con salida en texto. Moonshot posiciona el modelo para tareas de programación agéntica de largo horizonte y flujos de trabajo autoevolutivos, incluida una modalidad de "visión en el ciclo" que itera entre código y capturas de pantalla.
¿Qué tiene de nuevo su arquitectura?

La empresa introdujo dos piezas técnicas propias. La primera es Kimi Delta Attention (KDA), que según Moonshot habilita una decodificación hasta 6,3 veces más rápida en contextos de un millón de tokens. La segunda son los Attention Residuals (AttnRes), que la compañía asegura entregan cerca de 25% más de eficiencia de entrenamiento con menos de 2% de costo adicional.
Lectores técnicos que analizaron el reporte extrajeron detalles adicionales: un esquema LatentMoE con 16 expertos activados de un total de 896 (una tasa de activación inferior al 2%), balanceo de carga por cuantiles y una nueva función de activación llamada SiTU (Sigmoid Tanh Unit). El desarrollo de KDA no fue rápido: su diseño habría comenzado en enero de 2025 y tomó cerca de un año y medio en llegar a escala de frontera.
En el plano de infraestructura, el proyecto vLLM confirmó que Moonshot aportó directamente una implementación de prefix caching para KDA, disponible desde el día cero del lanzamiento oficial. La contribución fue necesaria porque KDA rompe los supuestos detrás del prefix caching convencional.
¿Cómo rinde frente a los modelos cerrados?
El resultado más comentado llegó desde Arena, la plataforma de comparación por preferencia humana. Kimi K3 se convirtió en número 1 del Frontend Code Arena con 1.679 puntos, superando a Claude Fable 5 y saltando desde el puesto 18 que ocupaba K2.6. Arena reportó además una tasa de victorias por pares de 76% en código frontend, frente a 63% de Fable 5 y 58% de GPT-5.6 Sol. En el Text Arena, el modelo entró al puesto 9 con 1.486 puntos, un salto desde el lugar 38.
Artificial Analysis, en una evaluación independiente, ubicó a K3 en 57 puntos de su Intelligence Index, un nivel comparable a Opus 4.8 y GPT-5.5, aunque todavía por detrás de Fable 5 y GPT-5.6 Sol en el agregado. La misma firma midió una exactitud de 46% frente a 33% en K2.6, pero advirtió un dato incómodo: la tasa de alucinación empeoró a 51% desde el 39% de la generación anterior.
| Métrica (Artificial Analysis) | Kimi K3 | Referencia |
|---|---|---|
| Intelligence Index | 57 | comparable a Opus 4.8 / GPT-5.5 |
| Costo por tarea | USD 0,94 | USD 1,04 (GPT-5.6 Sol), USD 1,80 (Opus 4.8) |
| Tokens de salida (índice completo) | 132 millones | 166 millones (K2.6), 21% menos |
| GDPval v2 (Elo) | 1.668 | 1.747,8 (GPT-5.6 Sol) |
¿Cuánto cuesta usarlo?
El precio reportado es de USD 3 por millón de tokens de entrada y USD 15 por millón de tokens de salida, con la entrada en caché descontada un 90% hasta USD 0,30 por millón. Una estimación combinada a 80% de entrada y 20% de salida arroja unos USD 5,40 por millón de tokens, frente a los USD 9 de Opus 4.8 y los USD 10 de GPT-5.5. Para un integrador o desarrollador en Chile, ese diferencial de costo, cercano a la mitad respecto de Opus, es el argumento más concreto: rendimiento de clase Opus 4.8 a una tarifa comparable a Sonnet 5.
Las primeras observaciones de servicio en vivo fueron más modestas, con velocidades de 26 a 28 tokens por segundo vía la API de Moonshot en OpenRouter, un ritmo que algunos calificaron de lento y que atribuyeron a que el speculative decoding aún no estaba habilitado. Moonshot recomienda desplegar el modelo en configuraciones de supernodo con 64 o más aceleradores para obtener la mejor eficiencia de inferencia.
Una advertencia sobre los benchmarks
No todo fue celebración. Ofir Press, autor de ProgramBench, señaló que Kimi usó una métrica que su equipo no recomienda: promediar el porcentaje de implementación en lugar de contar los programas que funcionan por completo, un enfoque que puede sobreestimar la utilidad real del modelo. La propia Moonshot reconoció que, pese a su competitividad, K3 aún arrastra una "brecha notoria en experiencia de usuario" frente a Claude Fable 5 y GPT-5.6 Sol.
Con todo, el lanzamiento fue leído por ingenieros y observadores como un hito para los modelos abiertos, comparable a los momentos que en su día marcó DeepSeek. Si los pesos se liberan como se prometió el 27 de julio, la comunidad tendrá el modelo de pesos abiertos más grande disponible para ejecutar y ajustar por cuenta propia.




