Saltar al contenido
Etiqueta

#coding agent

44 notas publicadas

Z.ai GLM 5.2: el modelo chino barato que reta a Opus 4.8
IA

Z.ai GLM 5.2: el modelo chino barato que reta a Opus 4.8

Su API cuesta 4,40 dolares por millon de tokens de salida, menos de un quinto que Opus 4.8, y expone lo caro que resultan los habitos de programacion con IA sin presupuesto.

IEEE Spectrum AI
Claude Tag ya genera el 65% de los PR del equipo Claude Code
IA

Claude Tag ya genera el 65% de los PR del equipo Claude Code

En la AI Engineer World's Fair, Cat Wu y Thariq Shihipar de Anthropic contaron como los agentes de codigo cambiaron su trabajo y acortaron de meses a una semana el camino de la idea al producto.

Simon Willison
xAI abre el código de Grok-Build tras una fuga masiva de datos
IA

xAI abre el código de Grok-Build tras una fuga masiva de datos

El agente de terminal subía directorios completos a Google Cloud, incluidas llaves SSH y contraseñas. Tras la reacción, xAI liberó las 844.530 líneas de Rust bajo Apache 2.0.

The Decoder
Grok 4.5 es tan barato que los benchmarks importan menos
IA

Grok 4.5 es tan barato que los benchmarks importan menos

El modelo de xAI queda detrás de Fable 5 y GPT-5.5 en varios benchmarks de programación, pero cuesta 2 dólares por millón de tokens de entrada y usa 4,2 veces menos tokens que Opus 4.8.

The Decoder
Meta lanza Muse Spark 1.1, su modelo de código con IA
IA

Meta lanza Muse Spark 1.1, su modelo de código con IA

El modelo multimodal para programación agéntica cuesta 1,25 dólares por millón de tokens de entrada y llega tarde frente a OpenAI y Anthropic, pero apuesta por el precio bajo.

TechCrunch AI
OpenAI: casi 30% del test de código SWE-Bench Pro falla
IA

OpenAI: casi 30% del test de código SWE-Bench Pro falla

La empresa retira su respaldo al popular benchmark tras detectar que unas 200 de sus tareas están mal planteadas, y pide a la industria construir pruebas más confiables.

The Decoder
Databricks adopta GLM 5.2 como motor de código por defecto
IA

Databricks adopta GLM 5.2 como motor de código por defecto

El modelo abierto chino igualó a Opus 4.8 en un benchmark interno de Databricks a 1,28 dólares por tarea frente a 1,94, y pasa a ser el modelo de trabajo diario de sus desarrolladores.

The Decoder
GPT-5.6 de OpenAI llega el jueves tras un freno del gobierno de EE.UU.
IA

GPT-5.6 de OpenAI llega el jueves tras un freno del gobierno de EE.UU.

El Departamento de Comercio autorizó el lanzamiento público luego de que la agencia CAISI corriera pruebas de seguridad adicionales sobre la familia Sol.

The Decoder
Zhipu AI lanza ZCode y desafía a Claude Code y Codex
IA

Zhipu AI lanza ZCode y desafía a Claude Code y Codex

La empresa china estrena un entorno de desarrollo agentico sobre GLM-5.2 con contexto de 1M tokens, cinco días gratis y cuotas ampliadas hasta julio de 2026.

The Decoder
Introspection: el loop del agente es el producto, no el modelo
IA

Introspection: el loop del agente es el producto, no el modelo

Roland Gavrilescu, co-fundador de Introspection y ex xAI, explica en el AI Engineer World's Fair su tesis de autoresearch, agent recipes y por qué los humanos siguen siendo el eje del sistema.

Latent Space
sqlite-utils 4.0rc2: Simon Willison lo pulió con Claude Fable por USD 14
IA

sqlite-utils 4.0rc2: Simon Willison lo pulió con Claude Fable por USD 14

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

Simon Willison
Cursor arma su fábrica de software con FDEs y planea 10x en 6 meses
IA

Cursor arma su fábrica de software con FDEs y planea 10x en 6 meses

Pauline Brunet, VP de Forward Deployed Engineering, explica cómo su equipo despliega agentes de ciclo largo dentro de bancos, telcos y fabricantes de chips para transformar el ciclo de desarrollo.

Latent Space
Loopcraft: el nuevo credo es diseñar loops, no prompts
IA

Loopcraft: el nuevo credo es diseñar loops, no prompts

El boletín AINews eleva a tesis lo que Peter Steinberger, Boris Cherny y Andrej Karpathy vienen repitiendo: sacar al humano del bucle y apilar loops autónomos que orquestan agentes.

Latent Space
Cursor lanza app móvil para orquestar agentes de código a distancia
IA

Cursor lanza app móvil para orquestar agentes de código a distancia

Anysphere presentó Cursor Mobile pocas semanas después de la adquisición por USD 60 mil millones anunciada por SpaceX. Permite crear y supervisar agentes de código desde el teléfono.

TechCrunch AI
Warp lanza Oz y apuesta por las 'software factories' automatizadas
IA

Warp lanza Oz y apuesta por las 'software factories' automatizadas

El CEO Zach Lloyd presentó en el AI Engineer World's Fair una plataforma para automatizar el ciclo completo de ingeniería de software, desde el triage hasta el despliegue.

Latent Space
OpenAI teasea hardware para Codex hecho con Work Louder
IA

OpenAI teasea hardware para Codex hecho con Work Louder

El dispositivo, que sale el 15 de julio, se parece al Creator Micro 2: un macro pad con 13 switches mecánicos, joystick y sensor táctil pensado para atajos.

The Verge
AIEWF: autoresearch y el pulso por la agencia humana en el loop
IA

AIEWF: autoresearch y el pulso por la agencia humana en el loop

Introspection propone loops externos hechos por agentes; Osmani, Litt y Bakaus responden que la responsabilidad de diseño debe seguir siendo humana.

Latent Space
Anthropic lanza Sonnet 5 y aprueba el regreso de Fable 5
IA

Anthropic lanza Sonnet 5 y aprueba el regreso de Fable 5

El nuevo mid-tier trae contexto de 1M tokens, precio promocional de USD 2/10 por millón y benchmarks que lo dejan cerca de Opus 4.8 pero con el doble de costo por tarea.

Latent Space
¿Podrá Cursor seguir sirviendo modelos de OpenAI y Anthropic dentro de S
IA

¿Podrá Cursor seguir sirviendo modelos de OpenAI y Anthropic dentro de S

La compra por USD 60.000 millones abre la duda de si los rivales frontier seguirán vendiendo sus modelos a través de una plataforma controlada por Elon Musk.

Wired
OpenAI lanza GPT-5.6 Sol, Terra y Luna solo a socios autorizados
IA

OpenAI lanza GPT-5.6 Sol, Terra y Luna solo a socios autorizados

El lanzamiento limitado responde a un pedido del gobierno de EE.UU. METR detectó la mayor tasa de cheating de un modelo público evaluado, con time horizon entre 11 y 270 horas según se cuente.

Latent Space
Opus 4.7 lidera MirrorCode con 56% reconstruyendo programas
IA

Opus 4.7 lidera MirrorCode con 56% reconstruyendo programas

En la nueva benchmark de Epoch AI y METR, GPT-5.5 alcanza 44% y Gemini 3.1 Pro un 32%; una tarea costó USD 2.600 y 19 días de inferencia continua sin intervención humana.

The Decoder
GLM-5.2 iguala a Opus 4.7 a un quinto del costo en Snowflake
IA

GLM-5.2 iguala a Opus 4.7 a un quinto del costo en Snowflake

El modelo chino de Zhipu AI resuelve 66% de 103 tareas de programación contra el 67% de Anthropic, pero quema casi el doble de tokens y suma latencia con 99 iteraciones por tarea.

The Decoder
OpenAI: tokens de Codex en Investigación crecieron 56x
IA

OpenAI: tokens de Codex en Investigación crecieron 56x

El reporte interno de OpenAI Economic Research detalla cómo el uso de Codex se profundizó entre noviembre de 2025 y junio de 2026 en investigación, soporte, ingeniería y legal.

Latent Space
Claude Tag lleva agentes proactivos y persistentes a Slack
IA

Claude Tag lleva agentes proactivos y persistentes a Slack

Anthropic estrena un agente que vive dentro de Slack, vigila canales sin ser invocado, etiqueta a compañeros responsables del código y dispara fixes cuando un A/B test cruza un guardrail.

Latent Space
GLM-5.2 destrona a Opus en frontend coding y suma IndexShare
IA

GLM-5.2 destrona a Opus en frontend coding y suma IndexShare

Z.ai libera GLM-5.2 con licencia MIT: 744B parámetros con 40B activos por token, ventana de 1M y un truco de sparse attention que baja 2.9× los FLOPs por token.

Latent Space
SpaceX compra Cursor por USD 60.000 millones
IA

SpaceX compra Cursor por USD 60.000 millones

Tras su IPO, Musk lleva su empresa de cohetes, IA y redes sociales a la pelea por el coding empresarial contra Claude Code y OpenAI Codex. El cierre se proyecta para el tercer trimestre de 2026.

The Verge
GLM-5.2 alcanza a Claude Opus 4.8 en coding maratónico
IA

GLM-5.2 alcanza a Claude Opus 4.8 en coding maratónico

El laboratorio chino Zhipu AI libera bajo licencia MIT un modelo con ventana de 1 millón de tokens que se queda a 1 punto de Anthropic en FrontierSWE.

The Decoder
SpaceX compra Cursor por US$60 mil millones para alcanzar a OpenAI
IA

SpaceX compra Cursor por US$60 mil millones para alcanzar a OpenAI

Apenas dos jornadas bursátiles después del IPO de SpaceX, la fusión con Anysphere busca darle a xAI los talentos y el cómputo que le faltaban en programación con IA.

The Decoder
Loopcraft: diseñar loops en lugar de promptear a agentes IA
IA

Loopcraft: diseñar loops en lugar de promptear a agentes IA

Peter Steinberger, Boris Cherny de Anthropic y Andrej Karpathy convergen en la misma idea: el cuello de botella ya no es escribir prompts, es seguir como humano dentro del loop.

Latent Space
Agentes IA aciertan el archivo pero fallan las líneas clave
IA

Agentes IA aciertan el archivo pero fallan las líneas clave

SWE-Explore, el primer benchmark que aísla la búsqueda de código de la reparación, revela que Claude Code, Codex y OpenHands solo cubren entre 14% y 19% de las líneas que importan.

The Decoder
OpenAI compra Ona (ex Gitpod) para acelerar Codex en tareas autónomas
IA

OpenAI compra Ona (ex Gitpod) para acelerar Codex en tareas autónomas

La startup alemana, fundada en Kiel en 2020, aporta entornos de desarrollo en la nube y agentes de IA con los que Codex podrá ejecutar tareas durante horas o días sin supervisión.

The Decoder
Kimi K2.7 Code: modelo abierto 12 veces más barato que Claude
IA

Kimi K2.7 Code: modelo abierto 12 veces más barato que Claude

Moonshot AI libera un modelo de pesos abiertos de un billón de parámetros enfocado en programación a USD 0,95 entrada y USD 4 salida por millón de tokens.

The Decoder
GitHub Copilot CLI suma LSP: del grep al go-to-definition
Open Source

GitHub Copilot CLI suma LSP: del grep al go-to-definition

El skill LSP Setup configura servidores para 14 lenguajes (Java, Python, TypeScript, Rust y más), reemplazando el grep sobre JARs y node_modules por análisis semántico estructurado.

GitHub Blog
Simon Willison prueba Claude Fable 5 cinco horas: una bestia lenta
IA

Simon Willison prueba Claude Fable 5 cinco horas: una bestia lenta

El desarrollador con acceso público al modelo lo somete a tareas de coding, conocimiento general y agentes. Veredicto inicial: probablemente el modelo más grande hasta ahora.

Simon Willison
JetBrains lanza Mellum2: MoE de 12B con licencia Apache 2.0
IA

JetBrains lanza Mellum2: MoE de 12B con licencia Apache 2.0

El modelo activa solo 2,5B parámetros por token, promete inferencia más de 2 veces más rápida que pares de tamaño similar y apunta a routing, RAG, subagentes y despliegues privados.

Hugging Face
George Hotz: los agentes de IA serán el error más caro del software
IA

George Hotz: los agentes de IA serán el error más caro del software

Tras seis meses probando coding agents en su proyecto tinygrad, el hacker se alinea con LeCun y Marcus: 'son modelos estadísticos que imitan código, no que lo entienden'.

The Decoder
Qwen3.7-Max corrió 35 horas solo para optimizar el chip propio de Alibab
IA

Qwen3.7-Max corrió 35 horas solo para optimizar el chip propio de Alibab

El nuevo modelo del equipo Qwen, exclusivo de la API de Alibaba Cloud, completó 432 tests de kernel y 1.158 tool calls sin intervención humana, logrando un speedup promedio de 10x.

The Decoder
Antigravity 2.0: Google estrena CLI, SDK y plan Ultra de USD 100
IA

Antigravity 2.0: Google estrena CLI, SDK y plan Ultra de USD 100

La app agéntica de codificación suma escritorio rediseñado, agentes en background y voz nativa apoyados en Gemini 3.5 Flash; el plan Ultra superior baja de USD 250 a USD 200.

TechCrunch
Anthropic proyecta USD 559 millones de utilidad operacional en Q2
IA

Anthropic proyecta USD 559 millones de utilidad operacional en Q2

El revenue Q2 saltó 130% hasta USD 10.900 millones, según el Wall Street Journal. La empresa redujo su costo de compute a USD 0,56 por dólar de ingreso, contra USD 0,71 en Q1.

The Decoder
Google libera Gemini 3.5: el modelo de la era de los agentes
IA

Google libera Gemini 3.5: el modelo de la era de los agentes

El primer release de la familia es 3.5 Flash, líder en agentes y coding sobre su antecesor Pro, con velocidad cuatro veces mayor que otros modelos frontier.

Google AI Blog
Deepseek arma equipo en Beijing para competir con Claude Code y Codex
IA

Deepseek arma equipo en Beijing para competir con Claude Code y Codex

La china Deepseek monta un equipo "Harness" en Beijing para construir su propio agente de programación, en competencia directa con los productos de Anthropic, OpenAI y Cursor.

The Decoder
Google lanza Antigravity 2.0 con app de escritorio, CLI y SDK
IA

Google lanza Antigravity 2.0 con app de escritorio, CLI y SDK

Coding agentic con orquestación multiagente, comandos por voz y exportación a AI Studio. La nueva versión usa Gemini 3.5 Flash y compite directo con Cursor y Claude Code.

TechCrunch AI
Anthropic mide el uso programatico de Claude y Codex gana terreno
IA

Anthropic mide el uso programatico de Claude y Codex gana terreno

Cada suscripcion Claude da creditos API mensuales por el monto del plan: harnesses como OpenClaw y claude -p pierden la subvencion mientras Codex gana fans entre AI engineers.

Latent Space

Etiquetas relacionadas

Otros temas que aparecen junto a #coding agent en nuestra cobertura editorial.