La empresa china de inteligencia artificial Moonshot AI anuncio Kimi K3 esta manana y lo describio como su "modelo mas capaz hasta la fecha, con 2,8 billones de parametros". Por ahora esta disponible a traves de su sitio web y su API, y la liberacion de pesos abiertos esta prometida "para el 27 de julio de 2026".

Moonshot lo presenta como el primer "modelo abierto de la clase 3 billones", arrebatandole la corona al v4 Pro de 1,6 billones de DeepSeek. Segun sus benchmarks autoinformados, K3 supera en la mayoria de las pruebas a Claude Opus 4.8 max y a GPT-5.5 high, aunque queda por debajo de Claude Fable 5 y GPT-5.6 Sol.

Que tan capaz es Kimi K3 en las mediciones independientes

El informe de Artificial Analysis aporta cifras concretas:

  • En su evaluacion privada de trabajo intelectual de largo horizonte, Kimi K3 alcanza un Elo global de 1547, 732 puntos mas que Kimi K2.6 y solo por detras de Claude Fable 5.
  • El costo por tarea (0,94 dolares) es similar al de GPT-5.6 Sol (1,04 dolares), cerca de la mitad que Opus 4.8 (1,80 dolares) y mas alto que sus pares de pesos abiertos.
  • El consumo de tokens bajo de forma notable: K3 usa un 21% menos de tokens de salida que K2.6.

El modelo ademas encabeza ahora el ranking de codigo frontend de Arena.ai, superando incluso a Claude Fable 5.

Cuanto cuesta y por que importa el precio

El precio es uno de los datos mas llamativos: 3 dolares por millon de tokens de entrada y 15 por millon de salida, el mismo nivel que la gama Claude Sonnet de Anthropic. Eso lo convierte en el modelo mas caro liberado hasta ahora por un laboratorio chino. Es un salto importante frente a modelos previos como Kimi K2.6, que costaba 0,95 y 4 dolares. Los 2,8 billones de parametros tambien mas que duplican el tamano de aquel modelo de 1 billon.

El test del pelicano en bicicleta

El analista Simon Willison sometio al modelo a su prueba habitual: generar un SVG de un pelicano montado en bicicleta.

Código
llm -m openrouter/moonshotai/kimi-k3 'Generate an SVG of a pelican riding a bicycle'

El dibujo le costo 95 tokens de entrada y 16.658 de salida (13.241 de ellos de razonamiento), para un total de 25 centavos de dolar. Como K3 acepta imagenes, Willison le pidio luego que describiera el propio SVG generado y obtuvo un texto alternativo muy preciso por apenas 0,6 centavos.

De ese ejercicio salen varias observaciones sobre el modelo:

  • Por ahora K3 tiene un unico nivel de esfuerzo de razonamiento, "max", y se nota: consumio 13.241 tokens de razonamiento para producir 3.417 de respuesta. Es caro.
  • El prompt "Generate an SVG of a pelican riding a bicycle" suma 95 tokens de entrada, cuando los tokenizadores de OpenAI y Anthropic cuentan entre 10 y 30. Un simple "hi" contabilizo 86 tokens, lo que sugiere un prompt de sistema oculto de unos 85 tokens que el modelo se nego a revelar.
  • La vision funciona bien: la descripcion de la imagen fue de buena calidad.

Sirve todavia comparar modelos con un pelicano

Willison es el primero en relativizar su propia prueba. El test tiene ya 21 meses y, admite, nunca fue un buen benchmark: nacio como una broma sobre lo absurdamente dificil que es comparar estos modelos. Durante el primer ano mostro una correlacion sorprendente con la calidad real, pero esa conexion hoy esta casi rota. Los pelicanos de GPT-5.6 y Claude Fable 5 quedan por debajo del de GLM-5.2, un modelo que Willison aprecia pero no considera de primer nivel.

La mayor limitacion, reconoce, es que el pelicano no toca lo que mas importa en los modelos actuales: el uso de herramientas de forma agentica y la capacidad de operar con fiabilidad a medida que las conversaciones se alargan.

Aun asi, el ejercicio conserva valor como "hola mundo" para probar un modelo, como estimacion rapida de costo y razonamiento, y como confirmacion de que el modelo genera SVG valido y entiende geometria basica, algo especialmente relevante en los modelos pequenos que corren en un portatil.