Meta liberó Muse Spark 1.3, su cuarto modelo de la serie en cinco meses, con mejoras concentradas en las tareas de agentes y un precio que hoy no tiene competencia dentro de su rango de puntaje. La versión xhigh ya está disponible a través de Muse Code y de la API de modelos de la compañía, mientras que la variante max, más intensiva en cómputo, sigue como vista previa limitada para socios hasta completar pruebas de seguridad adicionales, de acuerdo con las mediciones independientes de Artificial Analysis.
La serie partió en abril, con la versión 1.1 en julio y la 1.2 en agosto. El ritmo deja un modelo nuevo cada cinco o seis semanas.
¿Cuánto cuesta y por qué eso importa?

Los precios por millón de tokens se mantienen sin cambios: 1,25 dólares a la entrada y 4,25 dólares a la salida. Con ese esquema, una tarea del índice cuesta 0,55 dólares. Ningún modelo que puntúe 59 puntos o más resulta más económico, y los rivales que se ubican en el mismo nivel del índice cobran entre 0,94 y 1,23 dólares por tarea.
El dato tiene un matiz que conviene no pasar por alto: la versión anterior, Muse Spark 1.2, costaba 0,40 dólares por tarea. La mejora de rendimiento llegó junto con un alza de 37,5% en el costo unitario.
Llevado a volumen, la brecha se vuelve material. Mil tareas con Muse Spark 1.3 salen 550 dólares; esas mismas mil tareas con un rival de puntaje equivalente cuestan entre 940 y 1.230 dólares, una diferencia de hasta 680 dólares por cada mil ejecuciones.
| Modelo | Puntaje del índice | Costo por tarea |
|---|---|---|
| Muse Spark 1.3 (max) | 62 | sin precio anunciado |
| Muse Spark 1.3 (xhigh) | 61 | 0,55 dólares |
| Muse Spark 1.2 (agosto) | 57 | 0,40 dólares |
| Muse Spark 1.1 (julio) | 53 | no informado |
| Rivales de nivel comparable | 59 o más | 0,94 a 1,23 dólares |
¿En qué pruebas mejora de verdad?
En el Intelligence Index, la variante max anota 62 puntos y la xhigh 61, contra los 57 de agosto y los 53 de julio. El salto se explica en buena medida por cómo el índice pondera sus componentes: GDPval-AA v2 pesa 20%, Terminal-Bench 2.1 un 16% y τ³-Bench Banking un 14%. Las mayores ganancias de Meta caen exactamente en esas tres pruebas.
En τ³-Banking, donde los agentes operan herramientas dentro de un escenario bancario simulado, la variante max alcanza 52%. Es el primer lugar actual según Artificial Analysis y la única ventaja absoluta que el modelo sostiene. La versión xhigh, que sí está disponible, llega a 47% y empata con Claude Fable 5.1 (max) y con GLM-5.3-Flash en lugar de liderar. Para dimensionar el avance: la versión 1.2 se quedaba en 35%.
En Terminal-Bench 2.1, que evalúa programación en la terminal, la xhigh sube de 80 a 85% y la max llega a 86%. Claude Fable 5.1 conserva la punta con 91,4% en su variante max, 91,0% en xhigh y 89,9% en high.
En GDPval-AA v2, la prueba de mayor peso dentro del índice, Meta pasa de 1.615 a 1.709 puntos en xhigh y 1.754 en max, sobre una escala calibrada en 1.000 para el desempeño de expertos humanos en 220 tareas profesionales reales. Claude Fable 5.1 (max) se ubica en 1.853.
Esa ventaja de la variante max no sale gratis: consume 62% más tokens de razonamiento que la xhigh para conseguirla.
Fuera de las tareas de agentes sigue en el pelotón
En GPQA Diamond, que plantea preguntas científicas de nivel experto, Muse Spark sube de 90 a 94%. Queda en el grupo de arriba, aunque todavía por debajo de Gemini 3.8 Flash (high) con 95,3% y de Grok 4.6 (high) con 94,9%.
En CritPt, que cubre física de investigación, salta de 18 a 26%, bastante atrás de GPT-5.6 Sol (max) con 32,3% y de Claude Fable 5.1 (xhigh) con 31,1%.
Dos resultados incluso retroceden frente a la versión 1.2. AA-LCR cae de 83 a 79%. Y la exactitud factual medida en AA-Omniscience baja hasta tres puntos, porque el modelo se niega a responder con más frecuencia cuando no tiene certeza. Es un retroceso en la métrica que, visto de otra forma, describe un modelo más prudente.
¿Qué falta por conocer?
Ni Meta ni Artificial Analysis han puesto precio a la variante max, que hoy solo corre en vista previa para socios seleccionados. La compañía anticipó además modelos más grandes y una versión con pesos abiertos, sin fecha comprometida.
Para quien evalúa qué modelo poner detrás de un producto en la región, el cálculo cambia poco en calidad y mucho en cuenta final: un flujo de trabajo que hoy gasta 1.000 dólares mensuales en un modelo de nivel equivalente costaría cerca de 450 dólares con la variante xhigh de Muse Spark 1.3, siempre que las tareas se parezcan a las del índice.




