Artificial Analysis publicó la versión 4.2 de su Intelligence Index, probablemente en respuesta a las críticas de que sus pruebas no lograban capturar el progreso real de GPT-6 Astra.

Antes, varias evaluaciones, incluida la de la propia OpenAI, habían puesto a Astra bastante por delante del resto. Epoch AI lo ubicó primero entre 267 modelos, con 169 puntos repartidos en más de 50 pruebas, y ARC-AGI-3 mostró un salto de grande a muy grande según el arnés de evaluación utilizado. Artificial Analysis, en cambio, había puntuado a Astra apenas a la par de su antecesor.

¿Qué cambió en el ranking con la versión 4.2?

Con el índice actualizado, GPT-6 Astra exhibe ahora una ganancia de cuatro puntos sobre el modelo previo. Claude Fable 5.1, de Anthropic, sigue liderando la tabla, seguido por Astra en segundo lugar y por Meta en el tercero. Astra además usa menos tokens por tarea que cualquier otro modelo de frontera, según la misma consultora. En la relación costo-desempeño, Anthropic, OpenAI, Meta y Zhipu AI comparten el liderazgo.

Ambos modelos de OpenAI estaban empatados antes de la revisión: Astra quedaba al mismo nivel que Sol, su predecesor, pese a que otras evaluaciones lo separaban con claridad.

¿Qué pruebas entran y cuáles salen?

Cambio en la versión 4.2Detalle
Prueba nuevaAA-Briefcase, orientada al trabajo del conocimiento en escenarios reales
Prueba nuevaGDP.pdf, de Surge AI, para análisis de documentos en PDF
Prueba eliminadaGPQA-Diamond, descartada porque los modelos ya la resolvieron
PonderaciónLos datos de prueba privados pasan a representar el 40 por ciento del peso total
CorreccionesSe arreglaron errores de puntuación en varias pruebas y se ajustaron los sistemas de calificación

El punto menos vistoso de la lista es el más relevante: llevar los datos privados al 40 por ciento de la ponderación apunta directamente a que sea más difícil entrenar contra la prueba. Cuando el material de evaluación es público, un modelo puede llegar al examen habiéndolo visto, y la nota deja de medir capacidad para medir memoria.

La jubilación de GPQA-Diamond va en la misma dirección. Un banco de pruebas cuyos participantes ya lo resolvieron deja de discriminar entre ellos: todos sacan una nota parecida y el índice pierde poder de separación justo en el tramo alto, que es donde se juega la comparación entre modelos de frontera.

Una versión 5 que lleva ocho meses en preparación

Artificial Analysis explica que había postergado las actualizaciones para mantener estables los puntajes durante los lanzamientos grandes de modelos, pero que la cima de la tabla se movió tan rápido que una actualización intermedia se hizo necesaria. La versión 5 lleva ocho meses en desarrollo y saldrá por etapas, según la propia firma.

Para el lector técnico de la región, la lectura práctica es sencilla: ningún índice único basta hoy para decidir con qué modelo trabajar. Entre Epoch AI, ARC-AGI-3 y Artificial Analysis, el mismo modelo pasó de primero indiscutido a empatado con su antecesor en cuestión de días, sin que cambiara una sola línea de sus pesos. Lo que cambió fue la regla de medición.