Anthropic presentó Claude Fable 5.1 y Claude Mythos 5.1, que según la compañía son los modelos más avanzados del mundo para programación y trabajo de conocimiento, y cuyas capacidades de investigación ofrecen un anticipo de cómo los modelos de inteligencia artificial contribuirán al progreso científico.

Fable 5.1 y Mythos 5.1 son el mismo modelo, pero con distintos niveles de resguardos. Fable 5.1 está disponible de forma general, mientras que Mythos 5.1 solo se accede a través de los programas de acceso confiable de la compañía, y sus resguardos están diseñados específicamente para apoyar trabajo en ciberseguridad y ciencias de la vida.

Junto con el aumento de capacidades, Fable 5.1 responde a comentarios que la empresa recibió de sus clientes en tres frentes: precio, retención de datos y resguardos.

¿Cuánto más barato es en la práctica?

Fable 5.1 costará cerca de 25% menos que Fable 5 en cargas de trabajo típicas, en cualquier lugar donde el uso se facture por token. La razón es una reducción en el precio de las lecturas de caché, es decir, cuando el modelo lee entradas que ya fueron procesadas y almacenadas. Para trabajo altamente agéntico, el ahorro suele ser bastante mayor: hasta aproximadamente 45%.

En materia de retención de datos, el nuevo sistema de Enterprise Frontier Safeguards (EFS) entrega a los clientes privacidad completa, equivalente a una política de retención cero, sin dejar de ser de última generación en la prevención de usos adversarios. EFS funciona almacenando los datos en infraestructura de nube controlada enteramente por el cliente y no por Anthropic. Se irá liberando por fases a clientes empresariales a partir de fines de este otoño boreal. Mientras EFS no esté disponible, los clientes elegibles podrán usar Fable 5.1 con retención cero de datos.

En cuanto a los resguardos, la compañía dice haberlos mejorado para reducir los falsos positivos, es decir, los casos en que el sistema marca contenido inofensivo. En ciberseguridad, los resguardos más recientes bloquean 60% menos falsos positivos que antes. En parte se debe a que Fable 5.1 ahora puede usarse para descubrir vulnerabilidades de software, aunque no para desarrollar exploits que las aprovechen. En biología, Anthropic estableció un programa de acceso desarrollado en conjunto con el gobierno de Estados Unidos, para habilitar el uso de las capacidades avanzadas de biología de Claude Mythos 5.1. La inscripción para científicos se abriría pronto.

Una nueva frontera de rendimiento

Según Anthropic, Claude Fable 5.1 fija un nuevo estándar en programación, trabajo de conocimiento y tareas de resolución de problemas de larga duración. Cuando se configura en esfuerzo bajo o medio, el modelo alcanza resultados similares o mejores que los de Fable 5 a un costo bastante menor. Conviene tener presente la configuración por defecto: esfuerzo alto en Claude Code, y esfuerzo medio en Claude Cowork y en Claude.ai.

La compañía sostiene que Fable 5.1 evita los atajos que derivan en trabajo de peor calidad y que es capaz de corregir las causas raíz de los problemas de software. En pruebas realizadas por la firma de inversiones Millennium, el modelo encontró el origen de una caída poco frecuente en sus sistemas internos que ningún ingeniero de la firma, ni ningún otro modelo, había logrado explicar tras varios años de intentos.

¿Qué dijeron los socios de acceso anticipado?

Los socios que probaron el modelo antes del lanzamiento reportaron mejoras cuantitativas y también cualitativas. Uno de ellos describió el hallazgo del error que había resistido años de análisis.

"Un fragmento de código en particular tenía una caída extremadamente rara, cerca de una en un millón de ejecuciones, que nadie en nuestro equipo había explicado en cuatro o cinco años. Todos los modelos que probé, incluido Fable 5, la pasaron por alto. Claude Fable 5.1 fue el primero en encontrarla. Desensambló una biblioteca de un proveedor externo, la comparó contra el volcado de memoria y rastreó la caída hasta un error en esa biblioteca."

Otro socio puso el acento en la relación entre velocidad y costo.

"Es un Fable amable. Inteligencia de nivel Fable, precio de nivel Opus, velocidad de Sonnet. En nuestras pruebas fue cerca del doble de rápido que Opus 5 y usó la mitad de los tokens, así que para cualquiera acostumbrado a usar Opus como herramienta diaria es una mejora evidente."

En el terreno científico, un equipo relató una revisión de investigación clínica para Rakuten Medical.

"Le pedimos a Claude Fable 5.1 que revisara un proyecto de investigación clínica para Rakuten Medical que otros tres modelos de frontera habían aprobado. Encontró un vacío que ninguno de ellos había visto e insistió en seguir probándolo. Después propuso una hipótesis completamente nueva, y convirtió en una tarde un conjunto de datos que habíamos descartado en una nueva dirección de investigación."

Otro caso describe una corrida sin supervisión de 38 horas.

"Para cualquier cosa de investigación, desarrollo desde cero u horizonte largo, usaría sin duda a Claude Fable 5.1 como orquestador. Una corrida desatendida de 38 horas sobre un problema de aprendizaje automático diagnosticó un resultado previo como un artefacto de etiquetado, hizo la corrección, lanzó seis experimentos en paralelo que corrieron durante la noche y volvió con un resultado y pasos siguientes."

Los números que dejaron las evaluaciones

Los socios entregaron cifras concretas de sus propios conjuntos de evaluación. Estas son las más relevantes:

EvaluaciónClaude Fable 5.1Comparación
CursorBench 3.2 (esfuerzo máximo)73,4%El modelo más capaz corrido en ese banco
Banco de agentes de navegador82% de tareas completadas74% de Opus 5 y 57% de Fable 5
RedlineBench (revisión de contratos)57,047,9 con Fable 5
FrontierFinance (puntaje de rúbrica)55,9%49,2% con Fable 5
Banco interno de finanzasIgual precisión que Fable 520% menos tokens
Preferencia de jueces en conocimiento generalCerca de 2 a 1 sobre Fable 5Mejor anclaje de respuestas
Optimización de un kernel de cómputo35% de mejoraFable 5 se había estancado ahí

Otro socio destacó la legibilidad sostenida en tareas largas: "Mientras los modelos anteriores se volvían difíciles de seguir mientras más trabajaban, Fable 5.1 se mantiene legible en tareas largas de varios pasos". Y en el caso de un banco de investigación, un equipo señaló que en una tarea el modelo llegó a una solución novedosa por un eje completamente distinto al que habían visto en otros modelos o en investigadores humanos.

¿Qué pasa con la investigación científica?

Anthropic probó las capacidades de investigación científica de Claude Fable 5.1 y Claude Mythos 5.1 en un rango amplio de dominios. Según la compañía, lo que encontró suma evidencia de que los modelos de inteligencia artificial pronto harán contribuciones importantes al descubrimiento científico. Esa es, de hecho, la razón por la que Mythos 5.1 existe como producto separado: sus resguardos están calibrados para permitir trabajo en biología y ciberseguridad que la versión de disponibilidad general restringe.

Lectura para la región

Para equipos de desarrollo en Chile y Latinoamérica, el dato con efecto directo en presupuesto no es ninguno de los puntajes de la tabla anterior sino la rebaja en lectura de caché. Un flujo agéntico típico, el que revisa un repositorio completo en cada iteración, reenvía el mismo contexto una y otra vez, y ahí es donde aparece el ahorro cercano al 45%. Para un uso conversacional esporádico, en cambio, la diferencia se acerca más al 25% declarado para cargas típicas.

El segundo punto relevante es la configuración por defecto del nivel de esfuerzo, porque define cuánto se gasta sin que nadie lo decida explícitamente: alto en Claude Code y medio en Claude.ai. Según la propia empresa, en esfuerzo bajo o medio el modelo ya iguala o supera a Fable 5, lo que sugiere que subir a esfuerzo alto por defecto no siempre se justifica.