¿Por qué Claude Opus 5 domina el benchmark ARC-AGI-3?

Los creadores del benchmark ARC-AGI aseguran que el Claude Opus 5 de Anthropic debe su ventaja masiva en ARC-AGI-3 a una capacidad de razonamiento genuinamente superior. El modelo obtuvo un 30.2% en la prueba, consolidándose como el nuevo líder del sector. El récord anterior era de 7.8%, establecido por el GPT-5.6 Sol (Max) de OpenAI. Opus 5 logró resolver cinco entornos previamente no solucionados, cuatro de ellos con un desempeño igual o superior al nivel humano. Esto también lo posiciona por delante de los modelos "clase Fable" de Anthropic, que según ARC Prize, alcanzaron cerca de un 20%.

El análisis de ARC Prize atribuye este liderazgo a un razonamiento lógico más robusto, "que permite una exploración, planificación y ejecución más autónoma en entornos desconocidos". Durante las pruebas, Opus 5 exhibió comportamientos que los investigadores no habían observado anteriormente en ningún modelo. Por primera vez, el sistema tradujo tareas a notación algebraica y formuló ecuaciones de reflexión de forma independiente.

Gráfico comparativo del leaderboard ARC-AGI-3 mostrando la ventaja de Opus 5
Gráfico comparativo del leaderboard ARC-AGI-3 mostrando la ventaja de Opus 5

El Claude Opus 5 lidera el leaderboard de ARC-AGI-3 por un margen amplio, superando a GPT-5.6 Sol (Max) y otros competidores. Seis de los 25 entornos de demostración públicos han sido resueltos hasta la fecha. Los resultados completos, las repeticiones y el código de benchmarking están disponibles públicamente. En el benchmark anterior, ARC-AGI-2, Opus 5 obtiene un 90.4%, alcanzando un 97.5% en ARC-AGI-1. Ambos resultados igualan los puntajes máximos previos, aunque con costos ligeramente superiores según ARC Prize.

¿Qué mide realmente el benchmark ARC-AGI-3?

ARC-AGI-3 evalúa qué tan bien los modelos de IA resuelven tareas nuevas que no encontraron durante su entrenamiento, incluyendo aquellas que los humanos suelen manejar con facilidad. La versión actual funciona como un juego: el modelo debe inferir las reglas de un entorno interactivo, planificar sus acciones y ejecutarlas paso a paso. Esto pone a prueba el razonamiento general en lugar del conocimiento almacenado. Algunos sistemas de IA podrían haber superado el benchmark, pero dependen de software adicional conocido como harness. Los puntajes oficiales contabilizan solo el rendimiento del modelo de lenguaje por sí mismo. ARC Prize argumenta que los futuros sistemas AGI no deberían necesitar ayuda externa para resolver nuevas tareas; es probable que Opus 5 obtuviera un puntaje aún mayor si se utilizara dentro de Claude Code.

¿Son las ganancias en razonamiento realmente tan amplias?

Anthropic no ha explicado el origen de esta mejora, pero el etiquetado de datos específico y el aprendizaje por refuerzo son factores plausibles. A diferencia de modelos anteriores, Opus 5 fue desarrollado después de que ARC-AGI-3 y su formato se hicieran públicos. Esto pudo permitir a Anthropic enfocar las habilidades y formatos de rompecabezas del benchmark, aunque no demuestra que la compañía haya entrenado con las tareas exactas. Los anotadores podrían haber etiquetado trazas de razonamiento, acciones útiles, intentos fallidos y pasos de recuperación de rompecabezas similares. El aprendizaje por refuerzo podría recompensar la exploración, planificación, descubrimiento de reglas y autocorrección.

Esquema de las pruebas de razonamiento en entornos de juego interactivos
Esquema de las pruebas de razonamiento en entornos de juego interactivos

Las pruebas en Witness, el benchmark privado de Guanghan Ning para juegos de rompecabezas interactivos, sugieren ganancias más limitadas. Opus 5 obtuvo 43.4, empatando estadísticamente con Kimi K3 y Fable 5, mejorando mucho menos sobre Opus 4.8 de lo que lo hizo en ARC-AGI-3. El modelo identificó las reglas ocultas de un rompecabezas convencional antes de actuar, pero quedó por detrás de Opus 4.8 en un juego con mecánicas menos familiares. Ning señala que ese patrón encaja con el entrenamiento en datos específicos de género, aunque Witness no puede identificar qué datos utilizó Anthropic.

Greg Kamradt, uno de los investigadores detrás de ARC-AGI-3, afirmó que los resultados no descartan ganancias de razonamiento más amplias. Un juego basado en mecánicas familiares no prueba la adaptación a la novedad, mientras que un resultado débil no supera la mejora general del modelo sin puntajes detallados para esa tarea. Witness también fue diseñado en torno a rompecabezas al estilo de ARC-AGI-3, por lo que un mejor desempeño podría reflejar una transferencia real en lugar de memorización. Ning aclaró posteriormente que Opus 5 sí generalizó en Witness, solo que en menor medida que en ARC-AGI-3. Comparó el proceso con la evolución de los benchmarks de programación: a medida que ARC-AGI-3 se convierte en un objetivo principal para el razonamiento interactivo, atraerá el mayor esfuerzo de entrenamiento. Cubrir más casos borde podría ayudar a los modelos a generalizar a una gama más amplia de tareas de razonamiento abstracto. Vía The Decoder.