Anthropic presento Claude Opus 5, su nuevo modelo insignia, con una promesa directa: rendimiento cercano al de Claude Fable 5 en varias pruebas, pero a la mitad de la tarifa por token. La compania responde asi a la presion de precios de GPT-5.6 Sol y de los competidores chinos, y busca cerrar la brecha de costo y desempeno con el mucho mas caro Fable 5.
Opus 5 pasa a ser el modelo por defecto en Claude Max y el mas capaz disponible en Claude Pro. La ventana de contexto de 1 millon de tokens y las tarifas se mantienen: 5 dolares por millon de tokens de entrada y 25 por millon de salida, igual que su antecesor Opus 4.8. Un nuevo Fast Mode aumenta la velocidad 2,5 veces, pero duplica el precio.
¿Cuanto cuesta Opus 5 frente a Fable 5?
La diferencia de tarifas es el argumento central de Anthropic. Esta es la comparacion oficial por millon de tokens (MTok):
| Modelo | Entrada | Cache 5 min | Cache 1 h | Aciertos de cache | Salida |
|---|---|---|---|---|---|
| Claude Fable 5 | 10 USD | 12,50 USD | 20 USD | 1 USD | 50 USD |
| Claude Mythos 5 | 10 USD | 12,50 USD | 20 USD | 1 USD | 50 USD |
| Claude Opus 5 | 5 USD | 6,25 USD | 10 USD | 0,50 USD | 25 USD |
Anthropic advierte que las tarifas no cuentan toda la historia sin considerar la eficiencia de tokens. Opus 4.7 termino costando entre 30 y 40 por ciento mas por tarea que Opus 4.6, pese a compartir tarifas base, y un patron similar aparecio con Claude Sonnet 5.
¿Mas esfuerzo siempre rinde mejor?
Los usuarios pueden equilibrar desempeno y consumo de tokens con cinco niveles de esfuerzo: low, medium, high, xhigh y max. Anthropic recomienda usar de forma amplia los niveles "low" y "medium", que segun la empresa entregan buenos resultados con una fraccion del consumo y la latencia. Para programacion y tareas agenticas sigue sugiriendo partir en "xhigh".
Curiosamente, Opus 5 puntua algo peor en el nivel "max" que en el segundo mas alto en dos pruebas, pese a costar mas. La caida aparece en Frontier-Bench v0.1 y en el Artificial Analysis Coding Agent Index.
¿Le gana a Fable 5 en programacion?
Segun los propios benchmarks de Anthropic, Opus 5 marca records en varias evaluaciones. En Frontier-Bench v0.1 alcanza 43,3 por ciento en programacion agentica de terminal, superando por amplio margen a Fable 5 (33,7 por ciento), GPT-5.6 Sol (34,4 por ciento) y a su antecesor Opus 4.8 (21,1 por ciento). En el test de trabajo de conocimiento GDPval-AAv2 lidera con un Elo de 1.861, por delante de Fable 5 (1.747) y GPT-5.6 Sol (1.736).
No gana en todo. En programacion agentica via DeepSWE v1.1, GPT-5.6 Sol encabeza con 72,7 por ciento, seguido de Fable 5 (69,7 por ciento) y Opus 5 (68,8 por ciento). En tareas de salud y en pruebas legales, Fable 5 y Mythos 5 rinden mejor, respectivamente.
El resultado mas llamativo esta en ARC-AGI-3, que mide resolucion de problemas nuevos sin patrones memorizados. Ahi Opus 5 obtiene 30,2 por ciento, mientras Opus 4.8 apenas logro 1,5 por ciento y GPT-5.6 Sol un 7,8 por ciento. Es casi cuatro veces mas que el siguiente mejor modelo. No hay resultado de Fable 5 para esta prueba, y no esta claro si una ventaja tan grande se traducira en el uso real.
Un modelo que construye sus propias herramientas
Anthropic describe a Opus 5 como mucho mejor para revisar y mejorar su propio trabajo mediante iteracion. En una tarea de Frontier-Bench, el modelo recibio el dibujo de una pieza mecanica y debia crear un modelo 3D en FreeCAD, sin ninguna forma de ver el dibujo directamente. Opus 5 respondio escribiendo su propia canalizacion de vision por computador para extraer la geometria desde los pixeles, y reconstruyo la pieza completa. Ningun otro modelo resolvio la tarea tras cinco intentos, segun la empresa.
En otro caso, Opus 5 trabajo sobre un error real en un popular gestor de paquetes de codigo abierto: encontro la causa raiz y corrigio un caso limite que el parche de la comunidad habia pasado por alto. Un ingeniero de una firma de trading habria usado el modelo para construir un feed de datos de mercado para un nuevo exchange en una sola sesion, algo que modelos anteriores no lograban ni con planes detallados.
Menos bloqueos de ciberseguridad
La configuracion de seguridad de Opus 5 permite investigar vulnerabilidades sobre codigo fuente, pero bloquea el escaneo basado en binarios, las pruebas de penetracion y la generacion de exploits. Segun Anthropic, sus clasificadores de ciberseguridad se activan cerca de un 85 por ciento menos que en Fable 5, cuyas intervenciones frecuentes recibieron duras criticas. Las solicitudes bloqueadas en Claude.ai, Claude Code y Claude Cowork recurren por defecto a Opus 4.8 como respaldo.
En cambio, Opus 5 queda por detras de Mythos 5 en ciberseguridad ofensiva: encuentra vulnerabilidades casi tan bien como Mythos 5, pero rinde mucho peor al momento de explotarlas. Anthropic dice que, deliberadamente, no entreno a Opus 5 en tareas de ciberataque.
La empresa tambien lo califica como el modelo de disponibilidad general mas capaz para investigacion cientifica, con avances en quimica organica (10,2 puntos porcentuales mas en derivar estructuras moleculares desde datos de espectroscopia) y en tareas de proteinas (7,7 puntos porcentuales mas). Junto a Opus 5, Anthropic libera dos funciones en beta: cambios de herramientas a mitad de conversacion sin invalidar la cache del prompt, y respaldos automaticos que enrutan solicitudes bloqueadas a otro modelo.




