¿Qué hace exactamente GPT-5.6 Sol en ARC-AGI-3?

Tras el impacto provocado por Claude Opus 5 de Anthropic, que cuadruplicó el puntaje previo en el benchmark de lógica ARC-AGI-3, OpenAI ha salido al paso mostrando sus propios resultados. Según la compañía, su modelo GPT-5.6 Sol logra un 38,3% de efectividad utilizando dos configuraciones de API específicas, superando así el 30,2% registrado por el modelo de Anthropic.

Comparativa de rendimiento entre GPT-5.6 Sol y Claude Opus 5 en el benchmark ARC-AGI-3
Comparativa de rendimiento entre GPT-5.6 Sol y Claude Opus 5 en el benchmark ARC-AGI-3

El salto en el rendimiento de GPT-5.6 Sol es notable cuando se compara su ejecución bajo el harness de pruebas personalizado de OpenAI frente al entorno oficial. La diferencia radica en la implementación de técnicas de "Retained Reasoning" (razonamiento retenido) y "Compaction" (compactación), que permiten al modelo mantener su cadena de pensamiento entre pasos y resumir el contexto previo en lugar de truncarlo.

¿Por qué el entorno de pruebas cambia los resultados?

OpenAI no está utilizando el entorno de prueba estandarizado para estas cifras. En su lugar, el sistema procesa GPT-5.6 Sol a través de su propia Responses API, la cual integra las funciones mencionadas. En el harness oficial, donde el razonamiento del modelo se descarta tras cada acción, GPT-5.6 Sol apenas alcanzó un 7,8% de acierto.

La postura de OpenAI es que los benchmarks no miden únicamente la capacidad pura del modelo, sino también la infraestructura técnica que lo rodea. Si bien este argumento es válido en un entorno de desarrollo, el benchmark ARC-AGI-3 fue diseñado precisamente para medir el desempeño puro del modelo sin ayudas externas. Bajo esas condiciones, Opus 5 obtuvo su 30% y se estima que su rendimiento podría ser superior si se integrara en herramientas como Claude Code.

Vía The Decoder.