El 1 de septiembre de 2026 Anthropic liberó Claude Fable y Mythos 5.1, y sostiene que Fable 5.1 "fija un nuevo estándar en programación, trabajo de conocimiento y tareas de resolución de problemas de larga duración". El anuncio dedica un espacio notable a la investigación científica y presume un 52,6% en la nueva prueba Terminal-Bench-Science 0.1, anunciada el 27 de agosto, frente al 24,7% de Fable 5, el 29,0% de Opus 5 y el 22,4% de GPT-5.6 Sol. El resto de las pruebas muestra mejoras más discretas.

Pero la pregunta que interesa acá es otra: ¿qué tan bien dibuja pelícanos?

¿Sigue sirviendo la prueba del pelícano?

En julio, Simon Willison escribió que estaba perdiendo la fe en su propia prueba, porque la relación entre dibujar un pelícano en bicicleta y ser bueno en otras tareas ya no se sostiene con la fuerza que tenía en 2025. Lo que todavía entrega información útil, dice, son las comparaciones dentro de una misma familia de modelos y, sobre todo, entre distintos niveles de esfuerzo de razonamiento para el mismo prompt.

Fable 5.1 tiene cinco niveles de razonamiento: bajo, medio, alto, extra alto y máximo. No existe la opción de apagar el razonamiento por completo.

Antes de correr las pruebas, Willison corrigió un problema en llm-anthropic que impedía registrar correctamente los rastros de razonamiento. El conjunto completo de pelícanos, con la transcripción de razonamiento de cada nivel, quedó publicado en un gist.

¿Bajo y medio razonan o no?

El primer hallazgo es un misterio. En el nivel bajo, la transcripción no muestra ningún token de razonamiento resumido, y el conteo de salida fue de 1.998 tokens. En los modelos de Anthropic ese conteo incluye los tokens de razonamiento. Tomó 23,8 segundos y costó 10,017 centavos de dólar.

Al subir a nivel medio, el resultado fue este:

Ilustración plana y minimalista de un pelícano blanco con pico naranja andando en una bicicleta negra hacia la derecha, con líneas de movimiento detrás, sobre un fondo celeste.
Ilustración plana y minimalista de un pelícano blanco con pico naranja andando en una bicicleta negra hacia la derecha, con líneas de movimiento detrás, sobre un fondo celeste.

Curiosamente, esa corrida tampoco muestra texto de razonamiento y usó 1.977 tokens de salida, 21 tokens menos que el nivel bajo. Tardó 23 segundos y costó 9,912 centavos. Para este prompt en particular, "genera un SVG de un pelícano andando en bicicleta", Fable 5.1 parece saltarse el razonamiento por completo tanto en bajo como en medio.

¿Qué pasa en alto, extra alto y máximo?

En nivel alto la corrida tomó 29,6 segundos y 2.612 tokens de salida, por 13,087 centavos:

Ilustración plana minimalista de un pelícano blanco con pico naranja andando en una bicicleta negra, con sus patas naranjas pedaleando y líneas de movimiento detrás, sobre fondo celeste.
Ilustración plana minimalista de un pelícano blanco con pico naranja andando en una bicicleta negra, con sus patas naranjas pedaleando y líneas de movimiento detrás, sobre fondo celeste.

Acá sí aparece algo de razonamiento, aunque poco:

"Estoy planificando la disposición del SVG para un pelícano en bicicleta, con un fondo de cielo y suelo, una bicicleta con dos ruedas con rayos, cuadro, asiento y manubrio, y un pelícano de cuerpo blanco con cuello largo y pico naranja posicionado encima."

En nivel extra alto la cosa cambia de forma radical: 36.767 tokens de salida, 7 minutos y 51 segundos, 1,83 dólares.

Ilustración plana minimalista de un pelícano blanco con pico naranja andando en bicicleta hacia la izquierda, con las patas naranjas pedaleando y líneas de movimiento detrás, sobre fondo celeste.
Ilustración plana minimalista de un pelícano blanco con pico naranja andando en bicicleta hacia la izquierda, con las patas naranjas pedaleando y líneas de movimiento detrás, sobre fondo celeste.

El nivel máximo entregó, según Willison, el mejor pelícano que ha visto de un modelo de Anthropic: 65.927 tokens de salida, 13 minutos y 54 segundos, 3,30 dólares.

Ilustración plana minimalista de un pelícano blanco con pico naranja andando en bicicleta, con las patas pedaleando y líneas de movimiento que indican velocidad, sobre fondo celeste.
Ilustración plana minimalista de un pelícano blanco con pico naranja andando en bicicleta, con las patas pedaleando y líneas de movimiento que indican velocidad, sobre fondo celeste.

Hay bastante que rescatar en ese dibujo: el fondo es sobrio, las patas quedan claramente a ambos lados del cuadro, los pies están sobre los pedales, el ala sostiene el manubrio, el pelícano lleva un gorro azul y hay un canasto con un pescado. Sigue sin mostrar el mismo despliegue visual que Gemini 3.7 Flash, anota el autor, aunque tampoco lo había pedido.

Nivel de esfuerzoTokens de salidaTiempoCosto
Bajo1.99823,8 s0,10 USD
Medio1.97723 s0,099 USD
Alto2.61229,6 s0,131 USD
Extra alto36.7677 min 51 s1,83 USD
Máximo65.92713 min 54 s3,30 USD

La lectura de la tabla es directa: entre el nivel medio y el máximo hay 33 veces de diferencia en costo y 36 veces en tiempo de espera, para un dibujo que mejora, pero no 33 veces.

La versión animada

En Hacker News, el usuario swalsh comentó sobre el pelícano del nivel máximo: "ahora que es una prueba resuelta, ¿podemos tener la versión animada?".

Para no gastar otros 3 dólares, Willison tomó el pelícano del nivel máximo y lo pasó por el nivel de razonamiento alto, que viene por defecto:

Código
llm logs -cx | llm -m claude-fable-5.1 -s 'animate this'

Fueron 6.121 tokens de entrada y 26.201 de salida, es decir 1,37 dólares. El resultado quedó publicado acá y exportado a video, porque algunos navegadores tienen problemas con los SVG animados. En ese video las ruedas giran en el sentido equivocado, aunque el autor cree que es un artefacto de la conversión a MP4 y que en el SVG original giran bien.

Para quien programa en la región con presupuesto acotado, el dato práctico está en el extremo barato de la tabla: el nivel medio resolvió la tarea por menos de 10 centavos de dólar, mientras que el máximo cobró 3,30 dólares por el mismo encargo. Elegir mal el nivel de esfuerzo en una tarea repetitiva multiplica la factura por 33 sin que el usuario final note la diferencia.