OpenAI sostiene que puede seguir el ritmo en ARC-AGI-3. Después de que Claude Opus 5 de Anthropic cuadruplicara el récord en este benchmark de lógica, OpenAI mostró que GPT-5.6 Sol alcanza un 38,3% usando dos ajustes de su API, por encima del 30,2% de Opus 5.
¿Con qué configuración logra ese puntaje?

OpenAI no usa el entorno de prueba oficial. En cambio, corre GPT-5.6 Sol a través de su propia Responses API con dos funciones. La primera, "Retained Reasoning", conserva la cadena de razonamiento del modelo entre pasos. La segunda, "Compaction", resume el contexto antiguo en lugar de truncarlo. En el arnés oficial, GPT-5.6 Sol obtuvo apenas 7,8%, porque el razonamiento del modelo se descarta después de cada acción.
OpenAI argumenta que los benchmarks nunca miden solo al modelo, sino también el montaje técnico que lo rodea. Eso es cierto, pero ARC-AGI-3 fue diseñado justamente para evaluar el rendimiento puro del modelo. Los puntajes oficiales de ARC usan un enfoque estandarizado, sin ajustes específicos de cada proveedor, para asegurar comparaciones justas, según respondió ARC Prize a los resultados de OpenAI.
¿Dónde está el punto de fricción?
El nudo del debate es si ARC Prize usó una "API de completions al estilo OpenAI" más antigua, que carecía de funciones que la API de Claude ya ofrecía. De ser así, la comparación habría sido injusta para OpenAI.
El cofundador de ARC Prize, François Chollet, respondió distinguiendo entre dos tipos de configuraciones de prueba. Los arneses "hechos a medida para resolver el benchmark o que contienen conocimiento sobre su formato" quedan fuera de los límites, señaló. En cambio, los ajustes de API de propósito general "que no fueron desarrollados para ARC-AGI-3 y que están disponibles para todos los usuarios de la API" sí son válidos.
En la práctica, Chollet reconoce que el propio puntaje que ARC Prize había calculado para GPT-5.6 Sol dejaba a OpenAI en desventaja. Recordó que ARC Prize tuvo "mucho ida y vuelta con OpenAI sobre cómo probar mejor sus modelos, en especial respecto de la compactación", y celebró que la empresa "empiece a encontrar la respuesta".
Que distintos proveedores usen distintas configuraciones genera "un posible problema de paridad", admitió Chollet, aunque lo considera aceptable "mientras los ajustes y el costo se reporten con claridad".




