Los benchmarks discrepan sobre GPT-6 Astra

El nuevo modelo GPT-6 Astra de OpenAI está generando veredictos contradictorios en los benchmarks de la industria. Mientras que Epoch AI lo posiciona a la cabeza de la clasificación, el equipo de Artificial Analysis considera que no ofrece mejoras significativas respecto a su predecesor. La sorpresa más relevante surge del benchmark ARC-AGI-3, donde Astra demuestra ser más eficiente que el ser humano promedio por primera vez en un entorno de pruebas. François Chollet, director del ARC Prize, calificó este progreso como "dos veces más rápido" de lo previsto y ha decidido adelantar sus proyecciones sobre la llegada de la AGI (Inteligencia Artificial General).

Dos laboratorios independientes consolidan decenas de pruebas individuales en un único puntaje global, pero llegan a conclusiones opuestas. Epoch AI combina más de 50 benchmarks y coloca a GPT-6 Astra claramente en el primer lugar con 169 puntos, superando a 267 modelos. Por otro lado, Artificial Analysis evalúa conocimientos, programación y comprensión de texto, otorgando a GPT-6 Astra 61 puntos, situándolo exactamente al mismo nivel que su predecesor y por detrás de Claude Fable 5.1, que alcanza los 66 puntos.

Astra es notablemente más costoso que su versión anterior. OpenAI cobra dos veces y media más por cada unidad de texto procesado, lo que encarece la ejecución de tareas en aproximadamente un 75 por ciento en comparación con el modelo Sol. Al contrastarlo con Anthropic, la situación se invierte: en tareas de programación, Astra iguala el puntaje de Claude Fable 5 según Artificial Analysis, pero con un costo inferior a la mitad por tarea. La razón radica en la economía del modelo: solo requiere un tercio de los pasos de cómputo que utiliza Sol y un quinto de lo que consume Opus 5.

BenchmarkAstraSolFable 5.1Opus 5
Epoch ECI, puntaje global169162163162
AA Intelligence Index61616663
ARC-AGI-3, mundos desconocidos62.7%7.8%N/A30.2%
ARC-AGI-2, puzzles visuales95.0%92.5%90.0%90.4%
ARC-AGI-1, versión antigua98.5%97.5%97.5%97.5%
FrontierMath Erdős, matemáticas3%0%0%N/A

*Nota: GPT-6 Astra medido a alto esfuerzo de razonamiento; en su máximo alcanza el 97.5 por ciento. ARC-AGI-1 se considera actualmente un benchmark saturado.

En el Coding Agent Index, el modelo alcanza 67 puntos con aproximadamente un tercio del uso de tokens de Sol, mientras que Fable 5.1 lidera con 70 puntos. La tasa de alucinación en AA-Omniscience disminuyó del 92 al 51 por ciento. Simultáneamente, el modelo pierde cerca de 80 puntos Elo en GDPval-AA v2 y muestra un rendimiento inferior en soporte bancario, SciCode y tareas de razonamiento de contexto largo.

Epoch AI informa que en el nuevo FrontierMath Erdős, GPT-6 Astra fue el único modelo capaz de resolver dos de los 68 problemas abiertos de Erdős con pruebas verificadas en Lean, operando con un presupuesto de 300 dólares por intento. Se obtuvieron tres soluciones adicionales mediante ejecuciones extra no estandarizadas que consumieron más de 220,000 dólares en cómputo, aunque Epoch aclara que estos resultados no contabilizan para el puntaje final.

Un análisis detallado de las cifras individuales de Epoch revela que GPT-6 Astra y su rival Fable 5.1 han sido evaluados bajo condiciones distintas. Astra lidera en matemáticas, conocimiento y puzzles, mientras que Fable 5.1 mantiene las marcas más altas en casi todas las pruebas de programación. No obstante, Epoch solo ha registrado un puntaje de programación para Astra hasta la fecha, proveniente de una ejecución con nivel de razonamiento medio.

¿Por qué ARC-AGI-3 muestra un salto tan grande?

El salto más evidente ocurre en ARC-AGI-3. Esta prueba inserta a una IA en mundos de juego desconocidos cuyas reglas y objetivos no se explican previamente. El modelo debe deducir el funcionamiento mediante ensayo y error. GPT-6 Astra alcanza un 62.7 por ciento con un costo de prueba de aproximadamente 26,000 dólares. Su predecesor, GPT-5.6 Sol, obtuvo un 7.78 por ciento, mientras que el rival Claude Opus 5 logró un 30.16 por ciento. Fable 5 y Fable 5.1 aún no figuran en este benchmark.

El 99.9 por ciento reportado anteriormente por OpenAI se obtuvo bajo condiciones diferentes. En esa configuración, Astra utilizó el sistema de soporte (harness) diseñado por OpenAI, que mantiene cadenas de razonamiento entre solicitudes individuales y resume automáticamente ejecuciones largas. Según las mediciones de ARC Prize, esas ejecuciones fueron aproximadamente 3.66 veces más rápidas y utilizaron un 49 por ciento menos de tokens que las ejecuciones en el sistema interno, comparadas en 167 pares de razonamiento de juego que ambos sistemas resolvieron.

El uso de estos sistemas de soporte, y el salto de rendimiento asociado, ya fue un punto de fricción entre ARC Prize y OpenAI con el lanzamiento de GPT-5.6 Sol. ARC Prize señala que solo la cifra más baja del 62.7 por ciento, ejecutada en el sistema interno de ARC, permitió una comparación justa entre proveedores, aunque planean publicar las cifras de los sistemas de los proveedores en el futuro.

¿El aumento de pensamiento reduce los costos?

La relación entre el esfuerzo de pensamiento y el costo resulta inusual. Normalmente, un mayor nivel de razonamiento encarece la ejecución de la prueba. Con Astra sucede lo contrario: en el entorno estándar de ARC, los costos descienden de 49,791 dólares sin razonamiento a 26,098 dólares con el razonamiento máximo, mientras que el puntaje aumenta del 35.2 al 62.7 por ciento. Según ARC Prize, la razón es que Astra resuelve los juegos en menos movimientos, lo que implica menos llamadas al modelo y menos tokens.

Una curiosidad destaca: el nivel "bajo" puntúa un 17.5 por ciento, un resultado peor que ejecutar la prueba sin razonamiento alguno. ARC Prize no comenta sobre este dato atípico, pero GPT-6 Astra ha demostrado en otros benchmarks que puede resolver tareas de mayor horizonte sin razonamiento explícito debido a su nueva arquitectura, que presumiblemente procesa bucles internamente antes de generar el primer token.

!!Diagrama de eficiencia de Astra en ARC-AGI-3 Gráfico comparativo que muestra la reducción de movimientos necesarios para resolver niveles de juego por GPT-6 Astra frente a la media humana.

Como comparación, los evaluadores humanos recibieron 115 dólares por sesión de 90 minutos más 5 dólares por juego resuelto; realizando unos nueve intentos, el costo es de aproximadamente 12.78 dólares por juego. Sin embargo, esto cubre principalmente el tiempo y la disposición. Si solo se contabiliza la energía metabólica del cerebro como electricidad, ARC Prize estima un costo de 0.067 centavos por juego.

Más interesante que el puntaje bruto es la eficiencia. Antes del lanzamiento, ARC Prize registró a 500 evaluadores sin preselección y anotó, para cada nivel, la cantidad mediana de movimientos entre quienes lo resolvieron. En la ejecución con el sistema de OpenAI, Astra superó el 96 por ciento de los niveles en menos movimientos que esa mediana, promediando poco más de la mitad. A diferencia de las medidas de costo habituales, esta cifra no rastrea el cómputo consumido, sino cuánta experiencia con el entorno necesitó el modelo para dominarlo.

Aquí es precisamente donde los organizadores esperaban que los humanos mantuvieran una ventaja duradera. Esto sigue siendo válido para enfoques de fuerza bruta, pero con los modelos de vanguardia, ARC Prize observa un patrón casi binario. Una vez que el modelo ha comprendido la mecánica, su ejecución se sitúa en el rango de eficiencia humana.

¿Cómo desarrolla Astra su propia notación?

Para lograrlo, Astra mantiene sus propias notas y desarrolla una taquigrafía propia similar al álgebra, en la cual registra objetos, coordenadas, reglas y planes abiertos. Por ejemplo, utiliza extend8 to3; retract10 to2 como una secuencia ordenada de movimientos o Turn 5: P=(24,20), empty, facing west como una nota de estado. ARC Prize observó comportamientos similares en otros modelos, pero destaca a Astra por su precisión y densidad de información. En el sistema estándar, esta es una habilidad crítica, ya que todo lo que el modelo no guarda en sus notas visibles se pierde.

El cofundador de ARC, François Chollet, lo describe en X como "un modelado de mundo simbólico altamente eficiente y sobre la marcha para cada juego y nivel". El modelo llega al punto de "desarrollar su propia DSL (lenguaje de dominio específico) para representar situaciones dentro del juego", que en esencia es "una notación algebraica específica para cada juego". Lo que más importa a Chollet es el origen de este comportamiento: "Astra exhibe comportamientos de modelado simbólico que anteriormente solo habíamos visto con sistemas de soporte sofisticados; por tanto, las capacidades de estos sistemas están migrando cada vez más hacia el modelo mismo".

!!Ejemplo de notación simbólica de Astra Captura de pantalla mostrando cómo Astra genera una representación simbólica compacta de un entorno de juego para resolver el nivel s5i5.

Un tercer entorno de prueba demuestra lo que Astra es capaz de hacer con herramientas externas. PRO-LONG es un framework de agentes desarrollado por terceros que el equipo de ARC Prize desplegó tempranamente como socio de red-teaming para ARC-AGI-3, con el fin de explorar sistemáticamente los límites del modelo.

Vía The Decoder.