
Claude Opus 5 casi iguala a Fable 5 a mitad de precio
El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.
44 notas publicadas

Su API cuesta 4,40 dolares por millon de tokens de salida, menos de un quinto que Opus 4.8, y expone lo caro que resultan los habitos de programacion con IA sin presupuesto.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron como los agentes de codigo cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.
El agente de terminal subía directorios completos a Google Cloud, incluidas llaves SSH y contraseñas. Tras la reacción, xAI liberó las 844.530 líneas de Rust bajo Apache 2.0.
El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

El modelo multimodal para programación agéntica cuesta 1,25 dólares por millón de tokens de entrada y llega tarde frente a OpenAI y Anthropic, pero apuesta por el precio bajo.
La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.
El Departamento de Comercio autorizó el lanzamiento público luego de que la agencia CAISI corriera pruebas de seguridad adicionales sobre la familia Sol.
La empresa china estrena un entorno de desarrollo agentico sobre GLM-5.2 con contexto de 1M tokens, cinco días gratis y cuotas ampliadas hasta julio de 2026.

Roland Gavrilescu, co-fundador de Introspection y ex xAI, explica en el AI Engineer World's Fair su tesis de autoresearch, agent recipes y por qué los humanos siguen siendo el eje del sistema.

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

Pauline Brunet, VP de Forward Deployed Engineering, explica cómo su equipo despliega agentes de ciclo largo dentro de bancos, telcos y fabricantes de chips para transformar el ciclo de desarrollo.

El boletín AINews eleva a tesis lo que Peter Steinberger, Boris Cherny y Andrej Karpathy vienen repitiendo: sacar al humano del bucle y apilar loops autónomos que orquestan agentes.

Anysphere presentó Cursor Mobile pocas semanas después de la adquisición por USD 60 mil millones anunciada por SpaceX. Permite crear y supervisar agentes de código desde el teléfono.

El CEO Zach Lloyd presentó en el AI Engineer World's Fair una plataforma para automatizar el ciclo completo de ingeniería de software, desde el triage hasta el despliegue.

El dispositivo, que sale el 15 de julio, se parece al Creator Micro 2: un macro pad con 13 switches mecánicos, joystick y sensor táctil pensado para atajos.

Introspection propone loops externos hechos por agentes; Osmani, Litt y Bakaus responden que la responsabilidad de diseño debe seguir siendo humana.

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

La compra por USD 60.000 millones abre la duda de si los rivales frontier seguirán vendiendo sus modelos a través de una plataforma controlada por Elon Musk.

El lanzamiento limitado responde a un pedido del gobierno de EE.UU. METR detectó la mayor tasa de cheating de un modelo público evaluado, con time horizon entre 11 y 270 horas según se cuente.

En la nueva benchmark de Epoch AI y METR, GPT-5.5 alcanza 44% y Gemini 3.1 Pro un 32%; una tarea costó USD 2.600 y 19 días de inferencia continua sin intervención humana.

El modelo chino de Zhipu AI resuelve 66% de 103 tareas de programación contra el 67% de Anthropic, pero quema casi el doble de tokens y suma latencia con 99 iteraciones por tarea.

El reporte interno de OpenAI Economic Research detalla cómo el uso de Codex se profundizó entre noviembre de 2025 y junio de 2026 en investigación, soporte, ingeniería y legal.

Anthropic estrena un agente que vive dentro de Slack, vigila canales sin ser invocado, etiqueta a compañeros responsables del código y dispara fixes cuando un A/B test cruza un guardrail.

Z.ai libera GLM-5.2 con licencia MIT: 744B parámetros con 40B activos por token, ventana de 1M y un truco de sparse attention que baja 2.9× los FLOPs por token.

Tras su IPO, Musk lleva su empresa de cohetes, IA y redes sociales a la pelea por el coding empresarial contra Claude Code y OpenAI Codex. El cierre se proyecta para el tercer trimestre de 2026.

El laboratorio chino Zhipu AI libera bajo licencia MIT un modelo con ventana de 1 millón de tokens que se queda a 1 punto de Anthropic en FrontierSWE.

Apenas dos jornadas bursátiles después del IPO de SpaceX, la fusión con Anysphere busca darle a xAI los talentos y el cómputo que le faltaban en programación con IA.

Peter Steinberger, Boris Cherny de Anthropic y Andrej Karpathy convergen en la misma idea: el cuello de botella ya no es escribir prompts, es seguir como humano dentro del loop.

SWE-Explore, el primer benchmark que aísla la búsqueda de código de la reparación, revela que Claude Code, Codex y OpenHands solo cubren entre 14% y 19% de las líneas que importan.

La startup alemana, fundada en Kiel en 2020, aporta entornos de desarrollo en la nube y agentes de IA con los que Codex podrá ejecutar tareas durante horas o días sin supervisión.

Moonshot AI libera un modelo de pesos abiertos de un billón de parámetros enfocado en programación a USD 0,95 entrada y USD 4 salida por millón de tokens.

El skill LSP Setup configura servidores para 14 lenguajes (Java, Python, TypeScript, Rust y más), reemplazando el grep sobre JARs y node_modules por análisis semántico estructurado.

El desarrollador con acceso público al modelo lo somete a tareas de coding, conocimiento general y agentes. Veredicto inicial: probablemente el modelo más grande hasta ahora.

El modelo activa solo 2,5B parámetros por token, promete inferencia más de 2 veces más rápida que pares de tamaño similar y apunta a routing, RAG, subagentes y despliegues privados.

Tras seis meses probando coding agents en su proyecto tinygrad, el hacker se alinea con LeCun y Marcus: 'son modelos estadísticos que imitan código, no que lo entienden'.

El nuevo modelo del equipo Qwen, exclusivo de la API de Alibaba Cloud, completó 432 tests de kernel y 1.158 tool calls sin intervención humana, logrando un speedup promedio de 10x.

La app agéntica de codificación suma escritorio rediseñado, agentes en background y voz nativa apoyados en Gemini 3.5 Flash; el plan Ultra superior baja de USD 250 a USD 200.

El revenue Q2 saltó 130% hasta USD 10.900 millones, según el Wall Street Journal. La empresa redujo su costo de compute a USD 0,56 por dólar de ingreso, contra USD 0,71 en Q1.

El primer release de la familia es 3.5 Flash, líder en agentes y coding sobre su antecesor Pro, con velocidad cuatro veces mayor que otros modelos frontier.

La china Deepseek monta un equipo "Harness" en Beijing para construir su propio agente de programación, en competencia directa con los productos de Anthropic, OpenAI y Cursor.

Coding agentic con orquestación multiagente, comandos por voz y exportación a AI Studio. La nueva versión usa Gemini 3.5 Flash y compite directo con Cursor y Claude Code.

Cada suscripcion Claude da creditos API mensuales por el monto del plan: harnesses como OpenClaw y claude -p pierden la subvencion mientras Codex gana fans entre AI engineers.
Otros temas que aparecen junto a #coding agent en nuestra cobertura editorial.