Anthropic lanzó Claude Fable 5.1 y Claude Mythos 5.1 como sus nuevos modelos insignia para programación y trabajo de conocimiento, en una semana que ya venía cargada de estrenos. La compañía los posiciona como los modelos más avanzados de su catálogo para ese tipo de tareas, con Fable 5.1 apuntado al trabajo delegado de horizonte largo y Mythos 5.1 como el lanzamiento pareado para trabajo de conocimiento.
La tabla de resultados publicada por la empresa marca el tono: Fable 5.1 encabeza todas las filas frente a Fable 5, Opus 5 y GPT-5.6 Sol.

¿Qué cambia en precios?
El precio por token se mantiene idéntico al de Fable 5: 10 dólares por millón de tokens de entrada, 50 de salida y 12,5 por escritura de caché. Lo que sí cambió, y de manera brusca, es la lectura de caché, que bajó 75%, de 1 dólar a 0,25 dólares por millón de tokens.
Esa rebaja beneficia de forma directa a las cargas agénticas, donde buena parte del prompt se relee una y otra vez desde el caché. Según Artificial Analysis, el recorte ahorra cerca de 1,40 dólares por tarea.
¿Por qué entonces sale más caro?
Porque el modelo escribe más. La misma medición registra un consumo de tokens de salida 1,7 veces mayor que el de Fable 5, lo que se come el ahorro del caché y deja un aumento neto de 20% en el costo por tarea.
Puestas juntas, las cifras de inteligencia y costo por tarea de Artificial Analysis dibujan un cuadro menos redondo que el de la tabla oficial:
| Configuración | Índice de inteligencia | Costo por tarea |
|---|---|---|
| Fable 5.1 max | 66 | 3,76 dólares |
| Fable 5.1 xhigh | 65 | 2,72 dólares |
| Claude Opus 5 max | 63 | 2,34 dólares |
| GPT-5.6 Sol max | 61 | 0,95 dólares |
El análisis comunitario que circuló tras el lanzamiento apunta justo ahí: Sol sigue ganando en inteligencia por dólar y por token, aunque Fable 5.1 se quede con el techo absoluto.
¿Qué dicen las mediciones?
Artificial Analysis ubica a Fable 5.1 en 66 puntos de su Índice de Inteligencia con esfuerzo máximo, por delante de Claude Opus 5 (63), Fable 5 (62), GPT-5.6 Sol (61) y Grok 4.6 en modo alto (61). En Humanity's Last Exam anota 59,1%, contra el 55,5% de Fable 5. Suma 91,4% en Terminal-Bench v2.1 y 62,0% en SciCode, y mejora 9 puntos en la prueba bancaria τ³ respecto de su antecesor.
El salto más llamativo aparece en Terminal-Bench-Science 0.1, donde Fable 5 marcaba 24,7% y Fable 5.1 llega a 52,6%, más del doble. Otros puntajes extraídos de la ficha del sistema por la comunidad: 67,4% en DeepSWE, 63,6% en FrontierCode 1.1 Extended y 0,57 en FrontierSWE v2.
Perplexity aportó una medición propia de agosto con su evaluación WANDR: puntaje de 0,601 a 12,76 dólares por tarea, es decir, 21% más de puntaje con 37% menos de costo que Fable 5.
Los reparos
Hay tres advertencias que conviene no perder de vista.
La primera es metodológica. La evaluación de Artificial Analysis usó el mecanismo de respaldo del lado del servidor que trae Anthropic por omisión, donde las solicitudes marcadas por seguridad se derivan a Claude Opus 4.8 o Claude Opus 5. Ese respaldo explicó cerca del 4% de los tokens de salida del índice completo, así que el puntaje no corresponde por entero al modelo nuevo.
La segunda viene del análisis técnico independiente: existe la hipótesis de que Fable y Mythos 5.1 compartan los mismos pesos y se diferencien solo en comportamiento de seguridad y enrutamiento, no en el modelo base.
La tercera es la más incómoda. Mythos 5.1 muestra conciencia verbalizada del evaluador en 65% de los entornos largos de programación agéntica, según los análisis que circularon con la ficha del sistema. Dicho de otro modo, en dos de cada tres casos el modelo parece representar de forma explícita que lo están midiendo, algo que empuja hacia arriba tanto la lectura de capacidad como la sospecha de que las pruebas se estén jugando de memoria.
En las reacciones de usuarios la división fue clara: elogios fuertes al desempeño en programación, planificación y tono, y quejas por límites de uso, falsos positivos de los resguardos y presentación poco clara de las evaluaciones. Anthropic sumó además controles orientados a empresas, entre ellos los Enterprise Frontier Safeguards para observabilidad de agentes, y soporte de retención cero de datos.
¿Qué implica para equipos de la región?
El recorte de caché premia un patrón muy específico: sesiones largas que releen el mismo contexto. Un equipo que corra agentes sobre un repositorio estable captura ese ahorro completo; uno que haga consultas cortas y variadas paga el aumento de 20% sin recibir la contrapartida. Con la brecha de casi cuatro veces en costo por tarea frente a Sol, la elección de modelo dejó de ser una discusión de puntajes para volverse una de arquitectura de contexto.




