OpenAI liberó GPT-6 Astra, el modelo que la compañía describe como el más inteligente y alineado de su catálogo. A diferencia de los lanzamientos anteriores, la empresa no lo posiciona como un modelo de conversación sino como un sistema de uso de computador: la promesa es que Astra opera el software igual que una persona, a través de navegadores, planillas de cálculo, aplicaciones de escritorio y terminales, y que termina trabajos de varios pasos en vez de explicar cómo hacerlos.
El modelo es cerrado y hospedado, sin pesos liberados, así que la ejecución en hardware propio no es una opción. Por ahora está disponible solo para organizaciones inscritas en los programas Trusted Access y Daybreak de OpenAI.
¿Qué cambia realmente para quien programa?
El cambio principal está en el manejo del contexto. Codex venía usando compactación, es decir, resumía los turnos anteriores cuando el contexto se llenaba. Ese proceso descarta justo el detalle que un agente necesita después: por qué falló un arreglo, qué pruebas se corrieron, qué requisito se agregó al principio. Astra, en cambio, mantiene notas entre ventanas de contexto y puede buscar hacia atrás en mensajes y salidas de herramientas previas. La función se despacha en modo experimental detrás de un ajuste en config.toml y pasará a ser el comportamiento por omisión de Codex en las próximas semanas.
Astra también puede hacerle una pregunta al usuario mientras sigue trabajando en las partes de la tarea que no dependen de esa respuesta. Eso elimina una falla habitual de los agentes, donde una sola decisión pendiente deja todo el trabajo detenido.
En su ficha de modelo, Astra declara una ventana de contexto de 1.050.000 tokens, un máximo de 128.000 tokens de salida y corte de conocimiento al 30 de abril de 2026. Acepta texto e imagen como entrada y devuelve solo texto. El parámetro reasoning.effort suma dos niveles por encima de high: xhigh y max. El soporte de herramientas cubre uso de computador, shell hospedada, aplicación de parches, skills, MCP y búsqueda de herramientas. No admite ajuste fino.
¿Qué dicen los números?
OpenAI reporta 72,6% en OSWorld V2-Offline frente al 65,7% de GPT-5.6 Sol, con el tiempo promedio por tarea cayendo de unos 75 a unos 40 minutos. Anthropic reporta 77,9% para Claude Fable 5.1, pero aclara que usó una versión distinta de OSWorld y que las cifras no deberían compararse de forma directa.
Astra anota 99,9% en ARC-AGI-3. Ese número se produjo con un armado de la Responses API que retiene el razonamiento entre turnos y usa compactación para contextos largos, y OpenAI ya mostró antes que esos ajustes mueven de forma sustancial el puntaje en ARC-AGI-3 sin cambiar el modelo. El resultado mide al modelo más el sistema de agente que lo envuelve.
Otras cifras informadas: 97,6% en FrontierMath Tier 4, 95,9% en BenchCAD Vision2Code contra 84,3% de Fable 5.1, y 64,6% en Terminal-Bench Science contra el 52,6% reportado por Anthropic. Epoch AI advierte que OpenAI financió FrontierMath y tiene acceso exclusivo a parte del conjunto.
La programación es el punto débil del relato. Astra obtiene 74,1% en DeepSWE v1.1 contra 72,7% de Sol. Meta reportó 75,4% para Muse Spark 1.3 con razonamiento al máximo, y la tabla pública ubica a Gemini 3.8 Flash y Claude Opus 5 cerca del 74%. En una prueba de 113 tareas, esas diferencias son una o dos tareas.
Ordenados en una sola tabla, los resultados que la propia OpenAI publica dejan ver dónde está el salto y dónde no:
| Prueba | GPT-6 Astra | GPT-5.6 Sol | Otro referente |
|---|---|---|---|
| OSWorld V2-Offline | 72,6% | 65,7% | 77,9% Claude Fable 5.1 (otra versión) |
| DeepSWE v1.1 | 74,1% | 72,7% | 75,4% Muse Spark 1.3 |
| ExploitGym | 42,4% | 30,3% | sin dato |
| Tiempo por tarea | ~40 min | ~75 min | sin dato |
El contraste es nítido: el salto grande está en operar el computador y en seguridad ofensiva, no en escribir código.
¿Por qué el acceso está restringido?
Astra es el primer modelo que OpenAI clasifica en el umbral crítico de ciberseguridad de su Preparedness Framework. Durante las pruebas desarrolló exploits para navegadores y sistemas operativos endurecidos, y encontró dos vulnerabilidades desconocidas en V8 que, según la compañía, está reportando a quienes mantienen el proyecto.
Las consecuencias son concretas. El acceso estándar rechaza el trabajo avanzado de ciberseguridad, incluido el descubrimiento de exploits. Para quienes desarrollan con la API, una revisión de seguridad detiene la tarea por completo en vez de pausarla a la espera de aprobación. Mia Glaese, de OpenAI, advirtió que quienes estén fuera de los programas de acceso confiable pueden encontrarse con lentitud, pausas o bloqueos, a veces en medio de trabajo que no tiene relación con seguridad.
OpenAI reporta 100% en ExploitBench, que es un puntaje agregado de cobertura de capacidades y no una tasa de aprobación, y 42,4% en ExploitGym contra 30,3% de Sol, con el límite habitual de seis horas retirado en ambos casos.
¿Cuánto cuesta usarlo?
Astra cuesta 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida, con la entrada en caché a 1 dólar. Las solicitudes por sobre 272.000 tokens de entrada se facturan al doble en entrada y a 1,5 veces en salida, y esa penalización aplica a la solicitud completa. Los modos Batch y Flex corren al 50% de esa tarifa y el modo rápido al doble. Las cuentas Pro, Business y Enterprise reciben además Astra Pro.
Para equipos de la región conviene leer esas cifras junto al límite de 272.000 tokens: una sesión de agente que arrastre el historial completo de un repositorio grande cruza ese umbral con facilidad y duplica el costo de toda la llamada, no solo del excedente. La lógica de notas que reemplaza a la compactación empuja justamente en la dirección contraria, así que el ahorro real dependerá de qué tan disciplinado sea el manejo de contexto de cada equipo.
¿Cuándo llega al resto?
Por ahora, a nadie fuera de Trusted Access y Daybreak. OpenAI indicó que la API y la disponibilidad en AWS llegan en los próximos días, sin fecha comprometida. Para América Latina, donde el acceso a programas de socios confiables de OpenAI es marginal, eso significa que el modelo estará disponible en la práctica cuando se abra la API general, no antes.




