Simon Willison consiguió acceso a GPT-6 Astra y lo primero que hizo fue lo de siempre: pedirle SVGs de pelícanos andando en bicicleta, su prueba informal para medir modelos nuevos. Los generó en los cinco niveles de razonamiento que el modelo admite, low, medium, high, xhigh y max, porque Astra no acepta reasoning=none. Después los ordenó en una grilla comparativa junto a GPT-5.6 Sol, Terra y Luna. El resultado, además de entretenido, terminó siendo más informativo de lo que el ejercicio sugiere.
¿Qué tan mejores son los pelícanos de Astra?
La diferencia es amplia. El mejor pelícano de GPT-5.6 Sol, que según Willison es el de nivel xhigh y no el de max, sigue siendo un conjunto de formas abstractas bastante reconocible como tal. En cambio, todos los pelícanos de Astra, desde low hasta xhigh, se ven mejor que ese. El de nivel max, dice, es realmente bueno.
La excepción está en un detalle de composición: por debajo del nivel max, Astra todavía no ubica de manera confiable las patas del pelícano a ambos lados del cuadro.
¿Cuánto cuesta cada nivel de razonamiento?
Acá está el dato que descoloca. En tarifa de lista, Astra vale aproximadamente el doble que Sol:
- GPT-6 Astra: 10 dólares por millón de tokens de entrada y 50 dólares por millón de salida.
- GPT-5.6 Sol: 5 dólares por millón de entrada y 30 dólares por millón de salida.
Pero Astra consume bastante menos tokens en cada nivel, así que el precio final por imagen queda mucho más cerca de lo que la tarifa haría suponer. El caso extremo lo resume Willison en una línea: el pelícano de Astra en nivel low es mejor que cualquiera de los de GPT-5.6 Sol, en cualquier nivel, y cuesta 9,55 centavos de dólar. Gastar 10 centavos en cualquier otro modelo de la grilla entrega un resultado claramente peor.
Puesto en escala, ese mismo trabajo repetido mil veces son unos 95,5 dólares, y el punto de comparación no es un modelo más barato sino uno peor al mismo precio.
Un detalle raro en el conteo de entrada
Willison marca una curiosidad en la columna de tokens de entrada: Astra y Luna usaron 16 tokens cada uno para el mismo prompt, mientras que Sol y Terra usaron 26. Es una diferencia chica, pero llamativa, porque el prompt es idéntico y el conteo de entrada depende del tokenizador.
De ahí sale la especulación con la que cierra: quizá Astra y Luna tengan más parentesco entre sí del que OpenAI dejó ver al presentarlos.
Por qué esta prueba informal sigue sirviendo
El pelícano en bicicleta no es un benchmark académico y Willison nunca lo presentó como tal. Su valor está en otra parte: es una tarea que ningún laboratorio optimiza a propósito, que exige razonamiento espacial y generación de código estructurado al mismo tiempo, y que se puede evaluar de un vistazo. Para un equipo en Chile o la región que evalúa qué modelo poner en producción, la lección práctica no es cuál dibuja mejor un ave, sino que el precio por millón de tokens dice poco sin el consumo real de la tarea: dos modelos con tarifas al doble pueden terminar costando casi lo mismo por trabajo terminado.




