
OpenAI dice que GPT-5.6 Sol supera a Opus 5 en ARC-AGI-3
La empresa afirma que su modelo alcanza 38,3% frente al 30,2% de Claude Opus 5, pero solo cuando corre con dos ajustes propios de su API en lugar del entorno de prueba oficial.
5 notas publicadas

El nuevo buque insignia de Kimi suma 2,8 billones de parametros y un millon de tokens de contexto, pero rompe con la era del modelo chino ultrabarato.

El benchmark de Scale Labs y el Center for AI Safety mide agentes en 240 proyectos reales por USD 144.000: la tasa top se cuadruplicó en ocho meses.

El nuevo modelo agentic de Anthropic mejora en cada benchmark sobre Sonnet 4.6, se acerca a Opus 4.8 y en el test GDPval-AA v2 lo supera con 1.618 puntos frente a 1.615.

En la nueva benchmark de Epoch AI y METR, GPT-5.5 alcanza 44% y Gemini 3.1 Pro un 32%; una tarea costó USD 2.600 y 19 días de inferencia continua sin intervención humana.
Otros temas que aparecen junto a #benchmarks ia en nuestra cobertura editorial.