Mozilla publicó el 15 de septiembre la versión 1.1 de su informe State of Open Source AI, con datos actualizados al 1 de septiembre, y el número que ordena todo el documento es la distancia entre los modelos de pesos abiertos y la frontera cerrada estadounidense. El mejor modelo abierto quedó tres puntos bajo el líder cerrado en el Artificial Analysis Intelligence Index, con un precio equivalente al 60% del cerrado, y dos puntos detrás de Claude Fable 5 a un 30% del precio.
¿De dónde sale la cifra de cuatro meses?
El ajuste de Mozilla sobre los datos de horizonte de tarea de METR deja la brecha en torno a 4,4 meses, en línea con la estimación de cuatro meses de Epoch AI. METR es una organización de investigación sin fines de lucro que puntúa modelos según el largo de la tarea, medido en tiempo de trabajo humano, que el modelo completa la mitad de las veces.
Según el ajuste de Mozilla, los modelos cerrados resuelven tareas que a un experto humano le toman entre 8 y 12 horas. Los abiertos llegan a ese mismo punto unos cuatro meses después. La capacidad abierta duplica cada 3,9 meses y la cerrada cada 5,5 meses, según el cálculo del informe.
Quién firma el informe y con qué datos
Mozilla es la fundación sin fines de lucro detrás del navegador Firefox y su informe es una evaluación recurrente, publicada por primera vez el 14 de julio en el blog de la organización. Está construido sobre una encuesta de Mozilla y SlashData a cerca de 1.400 desarrolladores, datos de tráfico de OpenRouter e índices de pruebas de terceros.
Mozilla defiende los modelos abiertos, y TIME informó el 14 de julio que Raffi Krikorian, director de tecnología de la fundación, describió el informe como en parte una labor de incidencia. Conviene fijar el término. "Pesos abiertos" acá significa que los pesos se pueden descargar, no que estén disponibles los datos de entrenamiento ni el código. El informe cuenta 16 lanzamientos abiertos relevantes y ninguno entrega la receta de datos que exige la definición de la Open Source Initiative.
¿Qué muestran las pruebas de agentes?
Mozilla graficó también los resultados de Terminal-Bench 2.1 de vals.ai, que pasa todos los modelos por el mismo arnés, la capa de software que le ofrece sus herramientas al modelo. En ese tablero, GLM-5.2 de Z.ai quedó a menos de un punto de Claude Opus 4.7 y unos cuatro puntos detrás de Opus 4.8, a menos de un quinto del costo por prueba.
En OpenRouter, el mercado que enruta tráfico de desarrolladores hacia cientos de modelos, Mozilla contó ocho de los diez modelos más usados por volumen de tokens en agosto como modelos de pesos abiertos, siete de ellos construidos en China. El dinero cuenta otra historia. Los proveedores cerrados se llevaron el 96% de los ingresos de la capa de modelos en OpenRouter entre mayo y septiembre de 2025, según informó la Linux Foundation.
"Vemos la decisión de pagar por modelos cerrados como algo específico de cada carga de trabajo, más que específico de cada organización", dijo Krikorian a Ars Technica por correo electrónico.
¿Y si uno quiere correrlo en su propio servidor?
Acá aparece el reparo más grande del propio informe. La brecha de cuatro meses y el precio de 30% están medidos de API a API, sobre puntos de acceso alojados y a precio de lista. El gráfico de hardware de Mozilla cuenta otra cosa.
| Escenario | Puntaje del mejor modelo abierto | Distancia con la cima |
|---|---|---|
| Cabe en un servidor | 52,6 | 10 puntos |
| Cabe en una sola GPU | 40 | 23 puntos |
El punto de control nativo MXFP4 de Kimi K3 ocupa cerca de 1,56 TB repartidos en 96 fragmentos, y la configuración de servicio que lista Mozilla parte en 64 aceleradores. vLLM pide al menos ocho GPU GB300, con varios nodos para tráfico de producción. El informe lo describe como abierto pero no ejecutable por la mayoría de quienes lo tienen, y Tom's Hardware ya había estimado en julio esa necesidad de memoria cerca de 1,5 TB. La excepción que menciona el texto es Inkling-Small, de Thinking Machines, bajo licencia Apache 2.0, cuya versión NVFP4 entra en una sola B300 con un piso de 180 GB.
Lo que se movió después del 1 de septiembre
Los datos del informe se cortan el 1 de septiembre y el tablero siguió andando. Artificial Analysis pasó su índice a la versión 4.3 con un conjunto de evaluación distinto, así que sus números nuevos no son comparables con los de la 4.1.1 que graficó Mozilla. En el tablero en vivo, Claude Fable 5.1 marca 53 en su nivel de esfuerzo más alto y Kimi K3 llega a 44. El tablero de Terminal-Bench 2.1 de vals.ai, actualizado el 11 de septiembre, lo encabeza GPT-6 Astra con 87,27%, seguido de Fable 5.1 con 85,02%.
El propio pie de gráfico del informe lo dice de otra forma, "la brecha se reinicia en cada ciclo de lanzamientos".
La acusación que pesa sobre Kimi K3
El aviso conjunto de la NSA, CISA y el FBI del 8 de septiembre (AA26-251A) detalla una acusación contra K3. Sostiene que Moonshot habría extraído datos de Claude Fable 5 para entrenar su modelo mediante destilación, la práctica de entrenar un modelo con las salidas de otro. El informe de Mozilla la registra como una acusación "afirmada y no demostrada".
El 17 de julio, Artificial Analysis tenía a K3 en 57 contra los 60 de Fable 5. El 1 de septiembre, Mozilla lo medía dos puntos atrás.
La nota de Tom's Hardware la firma Shane Downing.




