
El 42% del código ya lo escribe la IA y el 96% desconfía
Una encuesta a más de 1.100 desarrolladores muestra que el 96% no confía plenamente en lo que produce el modelo, mientras las empresas rediseñan por completo su proceso de revisión.
28 notas publicadas

Cada sesión trabaja sobre su propio worktree de Git y conserva su contexto, así que se pueden lanzar tareas simultáneas sobre el mismo proyecto sin que se pisen entre ellas.

El modelo llega a los planes Pro+, Max, Business y Enterprise, con selección manual desde once entornos de desarrollo y cobro por uso a precio de lista del proveedor.

Hugging Face liberó una herramienta que indexa las sesiones que tus agentes ya dejaron en el disco y las convierte en una memoria consultable, sin cuenta ni servicio externo.

El cuarto modelo Spark en cinco meses apunta a tareas agénticas largas y programación, con menos idas y vueltas por tarea, pero con los pesos cerrados y su mejor modo de razonamiento bloqueado.

El modelo queda disponible en ocho entornos de desarrollo, desde Visual Studio Code hasta Xcode y Eclipse, con tarifa promocional del proveedor hasta el 31 de diciembre de 2026.

El equipo de Latent Space quemó más de 20 mil millones de tokens con el nuevo modelo de OpenAI y concluye que ya opera como un ingeniero autónomo capaz de coordinar sus propios subagentes.

El proxy traduce en ambos sentidos entre los formatos de OpenAI y Anthropic, así que Claude Code y Codex CLI pueden apuntar al mismo modelo sin tocar el agente.

El alza permanente que Anthropic aplicará el 14 de septiembre reemplaza un impulso temporal del 50%, así que en la práctica los usuarios quedan con menos capacidad semanal que hoy.

Z.ai liberó su primer modelo nativamente multimodal de la serie GLM-5, con un millón de tokens de contexto y precios diez veces menores que su antecesor.

Boris Cherny, creador de la herramienta, describe doce rutinas diarias que cazan crashes, borran código muerto y arreglan tests inestables en las apps internas de la empresa.

Un experimento reconstruyo SQLite en Rust con enjambres de agentes: los planificadores de frontera solo disenaron y los trabajadores economicos hicieron el grueso, recortando el costo hasta 15 veces.

El nuevo modelo insignia de Anthropic lidera en programacion agentica y trabajo de conocimiento, y cuesta la mitad por token que Fable 5.

Su API cuesta 4,40 dólares por millón de tokens de salida, menos de un quinto que Opus 4.8, y expone lo caro que resultan los hábitos de programación con IA sin presupuesto.

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron cómo los agentes de código cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

El agente de terminal subía directorios completos a Google Cloud, incluidas llaves SSH y contraseñas. Tras la reacción, xAI liberó las 844.530 líneas de Rust bajo Apache 2.0.

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

El modelo multimodal para programación agéntica cuesta 1,25 dólares por millón de tokens de entrada y llega tarde frente a OpenAI y Anthropic, pero apuesta por el precio bajo.

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

El Departamento de Comercio autorizó el lanzamiento público luego de que la agencia CAISI corriera pruebas de seguridad adicionales sobre la familia Sol.

La empresa china estrena un entorno de desarrollo agentico sobre GLM-5.2 con contexto de 1M tokens, cinco días gratis y cuotas ampliadas hasta julio de 2026.

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

Pauline Brunet, VP de Forward Deployed Engineering, explica cómo su equipo despliega agentes de ciclo largo dentro de bancos, telcos y fabricantes de chips para transformar el ciclo de desarrollo.

El CEO Zach Lloyd presentó en el AI Engineer World's Fair una plataforma para automatizar el ciclo completo de ingeniería de software, desde el triage hasta el despliegue.

Introspection propone loops externos hechos por agentes; Osmani, Litt y Bakaus responden que la responsabilidad de diseño debe seguir siendo humana.

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

La compra por USD 60.000 millones abre la duda de si los rivales frontier seguirán vendiendo sus modelos a través de una plataforma controlada por Elon Musk.
Otros temas que aparecen junto a #coding agent en nuestra cobertura editorial.