Claude Opus 5 ya está disponible

Representación visual de la interfaz de Claude Opus 5
Representación visual de la interfaz de Claude Opus 5

Claude Opus 5 está disponible desde hoy. Es un modelo reflexivo y proactivo que se acerca a la inteligencia de frontera de Claude Fable 5, pero a la mitad de su precio. En evaluaciones de codificación y trabajo de conocimiento como Frontier-Bench y GDPval-AA, Opus 5 se posiciona como el nuevo estado del arte, aunque permanece por detrás de Mythos 5 en tareas de ciberseguridad. Opus 5 está diseñado para el uso cotidiano: opera con mayor eficiencia que otros modelos. Actualmente, es el modelo predeterminado en Claude Max y el más potente en Claude Pro.

Rendimiento y costo-efectividad

Claude Opus 5 ofrece un rendimiento notablemente mejorado por el mismo costo que su predecesor, Opus 4.8. Los gráficos en esta sección ilustran cómo cambia el desempeño según el ajuste de esfuerzo del modelo, el cual los usuarios pueden emplear para optimizar la inteligencia o conservar tokens para obtener resultados más rápidos y económicos.

Opus 5 destaca en tareas valiosas de ingeniería de software. Por ejemplo, en Frontier-Bench v0.1, Opus 5 supera a todos los demás modelos y más que duplica el rendimiento de Opus 4.8 a un costo menor por tarea. En CursorBench 3.2, con esfuerzo máximo, el modelo alcanza una ejecución dentro del 0,5% del puntaje máximo de Fable 5, pero a la mitad del costo por tarea; además, logra un mejor desempeño a un costo determinado que todos los demás modelos en niveles de esfuerzo alto, muy alto y máximo.

Los gráficos anteriores muestran la escalabilidad del modelo. La optimización permite ajustar el consumo de recursos según la complejidad de la solicitud.

El despliegue de estas capacidades permite a los desarrolladores integrar Opus 5 en pipelines de producción sin incurrir en costos prohibitivos.

Observamos resultados similares en trabajo de conocimiento y resolución de problemas. Por ejemplo:

  • En ARC-AGI 3, una evaluación donde el modelo debe resolver problemas novedosos, el puntaje de Opus 5 es tres veces superior al del siguiente mejor modelo.
  • En Zapier AutomationBench, que mide si los modelos pueden completar tareas comerciales de principio a fin, la tasa de éxito de Opus 5 es aproximadamente 1,5 veces la del siguiente mejor modelo por el mismo costo. Incluso en su ajuste de esfuerzo más bajo, Opus 5 supera más tareas que cualquier otro modelo.
  • En OSWorld 2.0, un benchmark de uso de computadora, Opus 5 supera a todos los demás modelos a cualquier costo dado, superando el mejor resultado de Fable 5 a poco más de un tercio del costo.

También es nuestro modelo más eficiente en varias evaluaciones relacionadas:

La capacidad de razonamiento lógico se ha visto incrementada significativamente, como se observa en las pruebas de automatización.

Análisis de rendimiento en tareas de razonamiento lógico
Análisis de rendimiento en tareas de razonamiento lógico

El modelo demuestra una mayor consistencia al manejar flujos de trabajo de múltiples pasos.

La eficiencia en el consumo de tokens asegura que los usuarios mantengan un control presupuestario estricto.

El modelo mantiene su ventaja competitiva incluso en escenarios de alta carga de trabajo.

Estas métricas validan la superioridad del modelo en aplicaciones de negocio reales.

Opus 5 es una mejora significativa sobre Opus 4.8 para la investigación científica. Muestra un mejor desempeño en cada una de nuestras evaluaciones de ciencias de la vida, que cubren temas como biología estructural, química orgánica y bioinformática. Sus mejoras son más notables en tareas de química orgánica, como inferir estructuras moleculares a partir de datos de espectroscopia (obtiene 10,2 puntos porcentuales más que Opus 4.8 en nuestro benchmark interno), y en tareas relacionadas con proteínas como predecir cómo las variaciones en la secuencia de una proteína afectan su función (aquí, obtiene 7,7 puntos porcentuales más). Finalmente, Opus 5 es capaz de producir salidas visuales mucho más sólidas.

Trabajando con Claude Opus 5

Claude Opus 5 es mucho más sólido al verificar su trabajo e iterar cuidadosamente hasta alcanzar el éxito. En evaluaciones y pruebas de acceso anticipado, nosotros y nuestros usuarios encontramos muchos ejemplos de la agencia y exhaustividad de Opus 5:

  • En una tarea de Frontier-Bench, se le dio a Opus 5 un dibujo de una pieza de máquina y se le pidió que escribiera código para reconstruirla como un modelo 3D en FreeCAD. Sin embargo, en esta tarea, el modelo no tuvo forma de ver directamente el dibujo. Opus 5 respondió escribiendo su propio pipeline de visión artificial para extraer la geometría de los píxeles crudos y luego reconstruyó la pieza completa. Lo logró repetidamente; ningún modelo competidor con la misma configuración pudo resolverlo después de cinco intentos.
  • Ante un error real en un gestor de paquetes de código abierto popular, Opus 5 encontró la causa raíz y corrigió un caso borde que el parche de la comunidad había pasado por alto. Un modelo competidor corrigió solo el síntoma superficial (no la causa subyacente) y luego informó que el error estaba resuelto.
  • Un ingeniero en una firma de trading utilizó Opus 5 para construir un feed de datos de mercado para una nueva bolsa en una sola sesión. Modelos anteriores no pudieron completar esta tarea, incluso con planes extensos proporcionados por el ingeniero. Al no encontrar un feed en vivo para validar, Opus 5 incluso construyó su propio arnés de prueba para verificar que su código analizara los datos de la bolsa correctamente.

A continuación, se presentan otros informes de nuestros clientes de acceso anticipado sobre su experiencia trabajando con Opus 5:

Logo de Devin
Logo de Devin
En FrontierCode 1.1, Claude Opus 5 se acerca al rendimiento de nivel Fable a la mitad del costo. Dentro de Devin, también muestra una fuerza particular en tareas difíciles de depuración y análisis de causa raíz.
Logo de Cursor
Logo de Cursor
Claude Opus 5 ofrece una inteligencia cercana a Fable 5 a la velocidad y costo de Opus. En CursorBench está justo por debajo de Fable 5 y tiene muchos de los mismos comportamientos. Estamos emocionados de ver cómo los desarrolladores lo usan en Cursor.
Logo de Zapier
Logo de Zapier
Claude Opus 5 encabezó la tabla de clasificación de AutomationBench de Zapier sin gastar más tokens que los modelos Claude anteriores. Tomó un libro de trabajo de salud de cuenta y ejecutó una secuencia completa de prevención de abandono de principio a fin: marcando cuentas en riesgo, alertando al propietario correcto y resumiendo para operaciones de retención. Modelos anteriores no lo lograron; Opus 5 alcanzó el 100%.
Logo de empresa de genómica
Logo de empresa de genómica
En nuestro trabajo de análisis genómico, Claude Opus 5 se comporta más como un científico cuidadoso que cualquier modelo que hayamos ejecutado. Busca las pruebas estadísticas correctas para descartar factores de confusión, verifica sus propios resultados mediante métodos independientes y se mantiene encaminado a través de largos análisis de múltiples pasos.
Logo adicional
Logo adicional
Claude Opus 5 superó a todos los modelos de su familia en

Vía Anthropic.