Claude Opus 5, el nuevo modelo tope de gama de Anthropic, es hoy el sistema de IA mas capaz disponible segun varios benchmarks, con un rendimiento que iguala o supera a Fable 5 mientras cuesta menos por tarea. Los datos provienen de tres evaluadores independientes: Artificial Analysis, Epoch AI y Vals.ai.

¿Que tan capaz es Claude Opus 5?

Opus 5 obtuvo 61 puntos en el Artificial Analysis Intelligence Index, un indice que combina nueve pruebas de trabajo intelectual, programacion, razonamiento cientifico y precision factual. Ese resultado lo deja apenas por delante de Claude Fable 5 (60), GPT-5.6 Sol (59), Kimi K3 (57) y Claude Opus 4.8 (56). Artificial Analysis colaboro con Anthropic para evaluar el modelo antes de su lanzamiento publico.

ModeloIntelligence Index
Claude Opus 561
Claude Fable 560
GPT-5.6 Sol59
Kimi K357
Claude Opus 4.856

¿Como rinde en programacion?

En el Artificial Analysis Coding Index, Claude Opus 5 en el nivel "xhigh" junto a Claude Code comparte el primer lugar. El indice mide que tan bien resuelven los modelos tareas de programacion por su cuenta, incluida la deteccion y correccion de errores. En Terminal-Bench v2.1, que evalua a los agentes como ingenieros autonomos en entornos reales de terminal, Opus 5 obtuvo 89 por ciento en el nivel "max", igualando al lider previo GPT-5.6 Sol. En el Coding Agent Index, Opus 5 con Claude Code y GPT-5.6 Sol con Codex empatan la primera posicion con 67 puntos.

En razonamiento cientifico, Opus 5 alcanzo 53 por ciento en Humanity's Last Exam, una prueba de conocimiento de alta dificultad que cubre multiples campos academicos, empatando con Fable 5. En CritPt, un benchmark de fisica desarrollado por investigadores del Argonne National Laboratory y la UIUC, vuelve a igualar a Fable 5 pero queda por detras de GPT-5.6 Sol, GPT-5.5 Pro y GPT-5.6 Terra.

¿Donde falla todavia?

La precision factual sigue siendo su punto debil. En AA-Omniscience, que mide la exactitud de las afirmaciones de conocimiento del modelo, Opus 5 mejoro 7 puntos respecto de Opus 4.8, pero aun queda por debajo de Fable 5. Ademas, el modelo responde con mas frecuencia cuando no esta seguro, lo que eleva su tasa de alucinacion en 14 puntos, hasta 50 por ciento, una cifra que abre dudas sobre su fiabilidad en aplicaciones de alto riesgo.

Epoch AI tambien probo el modelo y le asigno un Epoch Capability Index de 159, apenas por debajo de Fable 5 (161). Al mirar solo los benchmarks de ingenieria de software (SWE-ECI), Opus 5 empata con Fable 5 en 161 y supera a GPT-5.6 Terra y a Opus 4.8. GPT-5.6 Sol lidera en ambas categorias. El panorama confirma que la carrera entre los modelos de frontera es estrecha y que ninguno logra despegarse con una ventaja clara, un argumento a favor de la tesis de que los modelos de IA tienden a volverse un producto basico intercambiable.

¿Cuanto cuesta usar Opus 5?

La tarea promedio del Intelligence Index cuesta 2,03 dolares con Opus 5, menos que los 2,75 dolares de Fable 5 con fallback, aunque mas que Opus 4.8 (1,80 dolares) y Sonnet 5 (1,53 dolares). En los tramos "high" y "xhigh", sin embargo, Opus 5 supera tanto a Opus 4.8 como a Sonnet 5 mientras cuesta menos.

El precio por token se mantiene en 5 dolares por millon de tokens de entrada y 25 dolares por millon de tokens de salida. La escritura en cache cuesta 6,25 dolares por millon con una vigencia de cinco minutos, mientras que los aciertos de cache quedan en apenas 0,50 dolares por millon.

¿Conviene el nivel de razonamiento mas alto?

No necesariamente. Vals.ai evaluo a Opus 5 en sus cinco niveles de razonamiento con Vibe Code Bench, un benchmark de programacion. Los puntajes suben desde 76,7 por ciento en "low" a 82 por ciento en "medium" y 89,8 por ciento en "high". El rendimiento cae en los dos niveles superiores: "xhigh" marca 88,3 por ciento y "max" 88,4 por ciento, pese a un costo mucho mayor.

Segun Vals.ai, los niveles mas altos tienden a producir soluciones mas complejas que contienen errores con mayor frecuencia. El nivel "high" genera soluciones mas simples que cumplen los requisitos de forma mas confiable. Terminal-Bench 2.1 muestra un patron similar: "high" supera a "max" porque en el tramo superior el modelo dedica mas tiempo a cada intento y alcanza a hacer menos intentos dentro del limite de tiempo. Esto coincide con la recomendacion de Anthropic, que fija "high" como nivel por defecto tanto en la API como en Claude Code.

¿En que tareas saca mas ventaja?

Opus 5 rinde especialmente bien en AA-Briefcase, un benchmark que mide como resuelven los modelos tareas tipicas de oficina, como redactar informes, armar presentaciones y analizar planillas a partir de miles de archivos de entrada. En razonamiento "max", Opus 5 alcanza un Elo de 1720, 146 puntos por delante de Fable 5 (1574). En GDPval-AA v2, el mismo nivel llega a un Elo de 1861, muy por encima de la linea base humana de 1000.

El costo por tarea en AA-Briefcase cayo 20 por ciento, a 17,79 dolares, frente a los 22,30 dolares de Fable 5. La variante "xhigh" cuesta 14,26 dolares y "high" queda en apenas 10,41 dolares, menos de la mitad que Fable 5, y ambas siguen superando a Fable 5 en el ranking Elo.

La mayor mejora aparece en calidad analitica: en "max", Opus 5 alcanza un Elo de 2016, casi 300 puntos por encima de Fable 5. En calidad de presentacion, en cambio, obtiene 1628 de Elo, unos 40 puntos por detras de GPT-5.6 Sol (1666). Ese rendimiento tiene un costo en tiempo: en "max", Opus 5 necesita mas de 36 minutos por tarea y promedia 103 pasadas, cerca de un 50 por ciento mas que Opus 4.8 (24 minutos y 55 pasadas).