Meta Superintelligence Labs liberó esta semana Muse Spark 1.3, el cuarto modelo de la familia Spark en cinco meses. El objetivo declarado ya no es la generación de una sola respuesta, sino el trabajo agéntico y de programación de horizonte largo: sostener un hilo extenso, colaborar con el usuario y reconocer cuándo se quedó atascado.

¿Se puede usar hoy?

Sí, con dos límites claros. Muse Spark 1.3 está disponible desde ya en Muse Code y en la Meta Model API, con una ventana de contexto de 1 millón de tokens, así que se puede llamar en producción. Lo que no se puede es alojarlo en servidores propios, porque los pesos siguen cerrados. Y el modo de razonamiento max continúa bloqueado a la espera de más pruebas de seguridad.

El precio no cambió respecto de la versión anterior: 1,25 dólares por millón de tokens de entrada y 4,25 por millón de salida, con un nivel para colaboradores de 0,10 y 0,20 dólares respectivamente.

¿Qué cambió realmente para los agentes?

Meta entrenó el modelo sobre varios entornos de agentes distintos para que el comportamiento no quedara pegado a uno solo. La idea es que sostenga varios flujos de trabajo dentro de un mismo hilo largo: frente a un objetivo abierto, reúne su propio contexto desde fuentes desordenadas y contradictorias, y después tapa los huecos de su plan.

Los cambios de colaboración son la parte más práctica. El modelo hace preguntas de aclaración cuando la instrucción es ambigua, involucra al usuario cuando se detiene y pide confirmación antes de acciones con consecuencias. En corridas largas se adapta a la preferencia de cada quien, sea con reportes frecuentes de estado o con ejecución silenciosa en segundo plano. Meta reporta además una mejor calibración sobre sus propios límites, de modo que el modelo señala los obstáculos en vez de inventar un resultado.

Programación y eficiencia

El entrenamiento incluyó más tareas de programación de horizonte largo. Frente a Muse Spark 1.2, Meta describe menos turnos innecesarios, menos verborrea y un estilo de código más limpio. En comparaciones internas de sus ingenieros, el modelo usó cerca de 20% menos llamadas a herramientas y 25% menos tokens.

Para cargas agénticas, ese es el número que se traduce en dinero: menos idas y vueltas y menos tokens facturados por cada tarea completada. Un equipo que hoy gasta 300 dólares mensuales en tareas agénticas con la versión 1.2 debería ver una factura menor con la 1.3 aunque el precio por token siga idéntico, porque el ahorro está en el consumo, no en la tarifa.

¿Cómo se compara con Claude y GPT?

Con las cifras de la propia Meta, el panorama queda así:

EvaluaciónMuse Spark 1.3Claude Opus 5GPT-5.6 Sol
DeepSWE v1.175.474.072.7
Terminal-Bench 2.188.886.788.8
MRCR v2 (256K a 512K)98.5sin dato91.5
MRCR v2 (512K a 1M)98.1sin dato73.8

La recuperación en contexto largo es la brecha más ancha: en el tramo de 512.000 a 1 millón de tokens, la diferencia frente a GPT-5.6 Sol supera los 24 puntos. En SWE-Atlas Codebase QnA el modelo alcanza 59.4.

Hay un detalle que conviene leer con cuidado. En las filas agénticas, la diferencia entre modos pesa mucho: Meta reporta OSWorld 2.0 en 66.9 para max contra 57.2 para xhigh, un Elo de 1.754 contra 1.709 en GDPval-AA v2, y 64.9 contra 61.2 en JobBench. Como Muse Spark 1.2 se evaluó en xhigh, parte del salto generacional es en realidad un cambio de nivel de razonamiento, no una mejora del modelo.

Artificial Analysis puntúa la variante xhigh, que es la que se puede usar hoy, con 61 en su índice de inteligencia, y la vista previa de max con 62. Eso deja a xhigh a la par de GPT-5.6 Sol en modo max y de Grok 4.6 en high, por detrás de Claude Opus 5 en max (63) y de Claude Fable 5.1 en max (66). La misma firma midió Tau3-Bench Banking en 47% para xhigh y 52% para max, el mejor resultado que ha registrado en esa evaluación.

Puntos clave

  • Muse Spark 1.3 está activo en Muse Code y en la Meta Model API, con ventana de contexto de 1 millón de tokens.
  • Los ingenieros de Meta midieron cerca de 20% menos llamadas a herramientas y 25% menos tokens frente a Muse Spark 1.2.
  • La tarjeta de resultados del lanzamiento usa el modo max, que no es el que un desarrollador puede llamar hoy.
  • El precio no cambió: 1,25 y 4,25 dólares por millón de tokens de entrada y salida.
  • Los pesos siguen cerrados, aunque Meta lista una liberación de pesos abiertos de Muse Spark en su hoja de ruta.

La empresa publicó también un informe de metodología de evaluación junto al anuncio.