
Claude Opus 5 lidera benchmarks y cuesta menos que Fable 5
El modelo de Anthropic encabeza el Artificial Analysis Intelligence Index con 61 puntos y baja el costo por tarea hasta la mitad en los tramos de razonamiento intermedios.
60 notas publicadas

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

Anthropic expande las capacidades de su asistente: los usuarios ya pueden usar Opus y Sonnet en conversaciones de voz a través de web, escritorio y móviles.

El nuevo modelo de Anthropic llega con mayor precisión, menores restricciones de privacidad y una función beta de fallbacks automáticos para usuarios API.

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

Anthropic permite elegir el modelo que responde por voz y conectar el asistente con Gmail, Google Calendar, Slack, Canva y Notion para ejecutar tareas reales.

El fabricante de chips financia al laboratorio detras de Claude, que a cambio desplegara hasta 2 gigavatios de GPU AMD Instinct MI450 en sistemas Helios desde 2027.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron como los agentes de codigo cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

El proyecto Puter recompiló el navegador de Mozilla a WebAssembly para que funcione completo dentro de Chrome, en un experimento que costó unos 25.000 dólares en tokens de Claude.
Desde el 20 de julio, Fable 5 quedará en Max y Team Premium con la mitad de los cupos ya reducidos, mientras los usuarios Pro pierden el acceso y reciben un crédito único de USD 100.

La oferta gratuita para docentes verificados de escuelas K-12 en Estados Unidos incluye Claude, Claude Code y el agente Cowork, con la promesa de no entrenar modelos con datos de estudiantes.

Un estudio de Anthropic sobre 309.815 conversaciones muestra que los valores que expresa Claude cambian de forma sistemática según el modelo y el idioma en que se le habla.

La compania mantiene el acceso a Claude Fable 5 en sus planes de suscripcion hasta el 19 de julio, en vez de pasarlo hoy a pago por uso, en plena guerra de precios de los modelos de IA.

Un análisis de Anthropic sobre 1,2 millones de sesiones muestra que la mitad del uso va a procesos de negocio y creación de contenido, y que programar es minoría.

El desarrollador Fabian Kubler dejo que el modelo Fable 5 de Anthropic escribiera y probara casi todo el port, que aprueba 430 de 468 tests del nucleo de MicroPython.

Desde el 12 de julio, los planes de 20, 100 y 200 dolares al mes deberan pagar tarifas por uso para acceder al modelo estrella de la compania, primer caso de un modelo de consumo con cobro por uso.
El equipo de Claude propone dos patrones que alcanzan hasta el 96 por ciento del rendimiento de Fable 5 a menos de la mitad del costo.

Los nuevos índices de Artificial Analysis colocan al modelo de Anthropic primero en finanzas, derecho y medicina, pero una sola tarea puede costar más de cien veces que una alternativa abierta.

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.

El Epoch Capabilities Index cambio de manos 17 veces desde que Claude 3 Opus destrono a GPT-4 en febrero de 2024, con estancias de siete semanas como mediana.

Anthropic estrena su Sonnet más autónomo con planificación, uso de navegador y terminal, desempeño cercano a Opus 4.8 y precio introductorio hasta el 31 de agosto de 2026.

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

La compañía apuesta a acortar el desarrollo de medicamentos de doce a siete u ocho años y duplicar la tasa de éxito, mientras Google DeepMind y OpenAI también corren por el mismo mercado.

Un desarrollador de Anthropic detalla técnicas para descubrir tus puntos ciegos antes de escribir el prompt, con ejemplos que van desde diseño visual hasta edición de video.

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

Tariq Shihipar, del equipo técnico, dice que los modelos Mythos son más imaginativos y funcionan mejor con menos instrucciones y ejemplos.

Consume 40% más tokens de salida que Sonnet 4.6 y triplica los ciclos de agente. El costo promedio salta de USD 1,20 a USD 2,29, aún más caro que el propio Opus 4.8.

Princeton diseñó un benchmark donde agentes IA dirigen una startup ficticia por 500 días simulados. La mayoría quiebra, y una heurística sin IA supera a casi todos los modelos probados.

El workbench agrupa más de 60 habilidades preconfiguradas en genómica, proteómica y química, corre local en macOS o Linux y escala a cientos de GPUs vía SSH o HPC.

El gobierno de EE.UU. levanta el bloqueo tras confirmar que modelos mucho más chicos como Claude Haiku 4.5 replican el mismo exploit; Mythos 5 sigue restringida.

Anthropic lanza Sonnet 5 con mejoras en su ventana de contexto de 1 millón de tokens y ajustes en su arquitectura de precios que impactan a los desarrolladores.

La nueva herramienta de Anthropic permite a los científicos usar agentes de IA con el respaldo de cómputo acelerado y microservicios NIM de NVIDIA.

Anthropic presenta Claude Tag, una nueva forma de integrar a Claude en flujos de trabajo de Slack, permitiendo delegar tareas complejas directamente en canales.

Anthropic presentó una plataforma para investigadores que conecta bases de datos, corre en infraestructura del laboratorio y usa un fact-checker para revisar citas antes de publicar.

El nuevo modelo agentic de Anthropic mejora en cada benchmark sobre Sonnet 4.6, se acerca a Opus 4.8 y en el test GDPval-AA v2 lo supera con 1.618 puntos frente a 1.615.

Anthropic, Microsoft y NVIDIA declaran la disponibilidad general de Claude sobre GPUs Blackwell Ultra y redes Quantum-X800 InfiniBand en Microsoft Foundry para agentes empresariales.

El lanzamiento limitado responde a un pedido del gobierno de EE.UU. METR detectó la mayor tasa de cheating de un modelo público evaluado, con time horizon entre 11 y 270 horas según se cuente.

Matei Zaharia apuesta por una arquitectura open source y pluggable que pretende estandarizar cómo se orquestan agentes de código y conocimiento dentro de una organización.

Tras dos semanas de bloqueo, el secretario Howard Lutnick autoriza a un grupo selecto de corporaciones y agencias federales a usar Mythos 5, aunque Claude Fable 5 sigue suspendido.

Anthropic encuestó a 9.700 usuarios de Claude Chat, Cowork y Code; a 12 meses, 26% espera que la IA cubra entre 60% y 90% de sus tareas laborales.

El nuevo buque insignia de OpenAI lidera benchmarks de coding agéntico y matchea a Mythos en ciberseguridad, pero Washington bloquea el lanzamiento abierto y la empresa critica la decisión.

Anthropic estrena un agente que vive dentro de Slack, vigila canales sin ser invocado, etiqueta a compañeros responsables del código y dispara fixes cuando un A/B test cruza un guardrail.

Datos de Indagari sobre 28 millones de tarjetahabientes muestran el avance del gasto en Anthropic; DataCamp reporta que la demanda de cursos de Claude triplica la de ChatGPT entre consumidores.

La nueva integración para Slack pone un único @Claude compartido por canal, con acceso a herramientas y código, y queda en beta para clientes Enterprise y Team corriendo sobre Opus 4.8.

Una directiva de control de exportaciones obliga a la empresa a deshabilitar sus modelos tope de gama para todos los usuarios, no solo extranjeros.

Anthropic abre su nuevo tope de gama a USD 10 por millón de tokens de entrada y USD 50 de salida, mientras Mythos 5 va a un grupo cerrado vía Project Glasswing.

El nuevo 'creative agent' orquesta workflows multi-paso adentro de Creative Cloud y como tool externa en los chats de OpenAI y Anthropic. Beta pública en cinco apps.

Adrian de Wynter usa el editor de mapas del juego de estrategia para mostrar que más de la mitad de los papers de IA recientes asumen rasgos humanos en los LLM antes incluso de empezar a medir.

La compañía pausa el plan que iba a entrar en vigencia el 15 de junio, en medio de una posible guerra de precios con OpenAI y la presión regulatoria del gobierno de EE.UU.

El asistente de OpenAI bajó a 46,4% de cuota global mientras Gemini llegó a 27,7% y Claude a 10,3%, según el State of AI Report 2026 de Sensor Tower.

Una directiva entregada el viernes a las 17:21 ET obliga a desactivar globalmente los dos modelos más potentes de la empresa por preocupaciones de seguridad nacional.

La compañía bajó el rendimiento de Mythos para usuarios que entrenan modelos rivales, lanzó Claude Design tras enrolar a Figma como partner y quintuplicó revenue hasta USD 50.000M en cinco meses.

Una orden federal de control de exportaciones obliga a la compañía a bloquear sus modelos más capaces para todo ciudadano extranjero, incluidos sus propios empleados.

Tras críticas duras de la comunidad de investigación, la compañía hará visibles los frenos que aplicaba en secreto a quienes intentaban entrenar modelos competidores con Claude.

La directiva de control de exportaciones prohíbe el acceso a cualquier extranjero, incluidos empleados de Anthropic, y deja a la empresa sin opción de bloqueo selectivo en tiempo real.

Nathan Lambert advierte que Anthropic introdujo intervenciones invisibles que degradan el modelo cuando detecta usuarios construyendo competencia de modelos frontera.

El nuevo tope de gama de Anthropic lidera el Artificial Analysis Intelligence Index con 64,9 puntos, pero su corrida completa de benchmarks bordea los USD 10.000, el doble que Opus 4.8.

La empresa recibió una directiva de export control citando seguridad nacional y un supuesto jailbreak. Anthropic argumenta que la vulneración es menor y contradice principios de proceso justo.

Su informe "When AI builds itself" alerta sobre bucles de autoperfeccionamiento, días después de filtrar confidencialmente una IPO valorada cerca de USD 965.000 millones.

El desarrollador con acceso público al modelo lo somete a tareas de coding, conocimiento general y agentes. Veredicto inicial: probablemente el modelo más grande hasta ahora.
Otros temas que aparecen junto a #claude en nuestra cobertura editorial.