Artificial Analysis publicó la versión 4.2 de su Intelligence Index, probablemente en respuesta a las críticas de que sus pruebas no lograban capturar el progreso real de GPT-6 Astra.
Antes, varias evaluaciones, incluida la de la propia OpenAI, habían puesto a Astra bastante por delante del resto. Epoch AI lo ubicó primero entre 267 modelos, con 169 puntos repartidos en más de 50 pruebas, y ARC-AGI-3 mostró un salto de grande a muy grande según el arnés de evaluación utilizado. Artificial Analysis, en cambio, había puntuado a Astra apenas a la par de su antecesor.
¿Qué cambió en el ranking con la versión 4.2?

Con el índice actualizado, GPT-6 Astra exhibe ahora una ganancia de cuatro puntos sobre el modelo previo. Claude Fable 5.1, de Anthropic, sigue liderando la tabla, seguido por Astra en segundo lugar y por Meta en el tercero. Astra además usa menos tokens por tarea que cualquier otro modelo de frontera, según la misma consultora. En la relación costo-desempeño, Anthropic, OpenAI, Meta y Zhipu AI comparten el liderazgo.
Ambos modelos de OpenAI estaban empatados antes de la revisión: Astra quedaba al mismo nivel que Sol, su predecesor, pese a que otras evaluaciones lo separaban con claridad.
¿Qué pruebas entran y cuáles salen?
| Cambio en la versión 4.2 | Detalle |
|---|---|
| Prueba nueva | AA-Briefcase, orientada al trabajo del conocimiento en escenarios reales |
| Prueba nueva | GDP.pdf, de Surge AI, para análisis de documentos en PDF |
| Prueba eliminada | GPQA-Diamond, descartada porque los modelos ya la resolvieron |
| Ponderación | Los datos de prueba privados pasan a representar el 40 por ciento del peso total |
| Correcciones | Se arreglaron errores de puntuación en varias pruebas y se ajustaron los sistemas de calificación |
El punto menos vistoso de la lista es el más relevante: llevar los datos privados al 40 por ciento de la ponderación apunta directamente a que sea más difícil entrenar contra la prueba. Cuando el material de evaluación es público, un modelo puede llegar al examen habiéndolo visto, y la nota deja de medir capacidad para medir memoria.
La jubilación de GPQA-Diamond va en la misma dirección. Un banco de pruebas cuyos participantes ya lo resolvieron deja de discriminar entre ellos: todos sacan una nota parecida y el índice pierde poder de separación justo en el tramo alto, que es donde se juega la comparación entre modelos de frontera.
Una versión 5 que lleva ocho meses en preparación
Artificial Analysis explica que había postergado las actualizaciones para mantener estables los puntajes durante los lanzamientos grandes de modelos, pero que la cima de la tabla se movió tan rápido que una actualización intermedia se hizo necesaria. La versión 5 lleva ocho meses en desarrollo y saldrá por etapas, según la propia firma.
Para el lector técnico de la región, la lectura práctica es sencilla: ningún índice único basta hoy para decidir con qué modelo trabajar. Entre Epoch AI, ARC-AGI-3 y Artificial Analysis, el mismo modelo pasó de primero indiscutido a empatado con su antecesor en cuestión de días, sin que cambiara una sola línea de sus pesos. Lo que cambió fue la regla de medición.




