Saltar al contenido

IA

Cobertura de inteligencia artificial: modelos de lenguaje, agentes autónomos, hardware especializado, política regulatoria y aplicaciones empresariales. Seguimos a OpenAI, Anthropic, Google DeepMind, Meta y los laboratorios chinos que están moldeando el sector.

604 notas publicadas · Página 20 de 26
DiscoBench: los agentes IA fallan al preguntar, no al buscar

DiscoBench: los agentes IA fallan al preguntar, no al buscar

Un benchmark de Tencent Hunyuan y Tsinghua muestra que Gemini 3.1 Pro y Claude Opus 4.7 quedan bajo 50% porque asumen en vez de pedir aclaraciones cuando la consulta es ambigua.

The Decoder
Mensch (Mistral): 'los labs cerrados ven tus procesos internos'

Mensch (Mistral): 'los labs cerrados ven tus procesos internos'

El fundador francés advierte que confiar en modelos propietarios abre la puerta a que los proveedores de IA compitan luego contra sus propios clientes con la data que acumulan.

The Decoder
Claude Science: Anthropic estrena workbench para científicos

Claude Science: Anthropic estrena workbench para científicos

La nueva app en beta integra más de 60 skills para genómica, proteómica y química, corre en el HPC del laboratorio y deja auditables cada figura y cada cálculo.

Anthropic
Claude Sonnet 5 llega con perfil agéntico y USD 2 por millón

Claude Sonnet 5 llega con perfil agéntico y USD 2 por millón

Anthropic estrena su Sonnet más autónomo con planificación, uso de navegador y terminal, desempeño cercano a Opus 4.8 y precio introductorio hasta el 31 de agosto de 2026.

Anthropic
Skill engineering: la disciplina que rechaza el diseño IA de un solo

Skill engineering: la disciplina que rechaza el diseño IA de un solo

Paul Bakaus, creador de *Impeccable*, defiende un modelo donde el agente entrega el 80% y el humano custodia el 20% final. Sin auto mode. Nunca.

Latent Space
sqlite-utils 4.0rc2: Simon Willison lo pulió con Claude Fable por USD 14

sqlite-utils 4.0rc2: Simon Willison lo pulió con Claude Fable por USD 14

El creador de Datasette relata cómo el modelo de Anthropic encontró cinco *release blockers* en 37 prompts, incluyendo un bug que borraba tablas enteras al cerrar la base.

Simon Willison
Cursor arma su fábrica de software con FDEs y planea 10x en 6 meses

Cursor arma su fábrica de software con FDEs y planea 10x en 6 meses

Pauline Brunet, VP de Forward Deployed Engineering, explica cómo su equipo despliega agentes de ciclo largo dentro de bancos, telcos y fabricantes de chips para transformar el ciclo de desarrollo.

Latent Space
Alibaba prohíbe a sus empleados usar Claude Code desde el 10 de julio

Alibaba prohíbe a sus empleados usar Claude Code desde el 10 de julio

El grupo chino clasifica la herramienta de programación de Anthropic como software de alto riesgo tras un experimento marzo que identificaba usuarios chinos, según Reuters y Morningstar.

TechCrunch AI
Anthropic entra a fabricar drogas para enfermedades no rentables

Anthropic entra a fabricar drogas para enfermedades no rentables

La compañía apuesta a acortar el desarrollo de medicamentos de doce a siete u ocho años y duplicar la tasa de éxito, mientras Google DeepMind y OpenAI también corren por el mismo mercado.

The Decoder
pxpipe: convertir texto en PNG recorta hasta 70% los tokens

pxpipe: convertir texto en PNG recorta hasta 70% los tokens

El proxy open source aprovecha que Anthropic cobra imágenes por dimensiones, no por caracteres, y comprime prompts largos en una sola página densa.

The Decoder
Leanstral 1.5 de Mistral: 100% en miniF2F y caza 5 bugs

Leanstral 1.5 de Mistral: 100% en miniF2F y caza 5 bugs

El modelo open-source (Apache 2.0) para verificación formal en Lean 4 lidera PutnamBench entre pesos abiertos y detectó overflows reales en 57 repositorios.

The Decoder
Andrew Qu (Vercel): los agentes son un software nuevo

Andrew Qu (Vercel): los agentes son un software nuevo

El Chief of Software de Vercel explica cómo nació eve, su framework de agentes, por qué las skills reemplazan la información desactualizada del modelo y qué gana una web que sirve markdown a los bots.

Latent Space
26 mil alumnos chinos: la IA baja 24% las notas de examen

26 mil alumnos chinos: la IA baja 24% las notas de examen

Un estudio panel de 30 meses documenta cómo el uso de asistentes IA acelera la tarea pero desploma los puntajes en exámenes cerrados; el daño en la prueba de acceso tarda dos años en aflorar.

The Decoder
Fable 5: el cuello de botella pasó del modelo al usuario

Fable 5: el cuello de botella pasó del modelo al usuario

Un desarrollador de Anthropic detalla técnicas para descubrir tus puntos ciegos antes de escribir el prompt, con ejemplos que van desde diseño visual hasta edición de video.

The Decoder
Anthropic estrena Claude Tag y AIEWF cierra con debate sobre loops

Anthropic estrena Claude Tag y AIEWF cierra con debate sobre loops

El AI Engineer World's Fair cerró con Ralph Loop y HumanLayer discutiendo si las software factories son viables, una encuesta con 95% de adopción de agentes y la presentación pública de Claude Tag.

Latent Space
Gemma 4 12B, Android 17 y Nano Banana 2 Lite: junio en Google

Gemma 4 12B, Android 17 y Nano Banana 2 Lite: junio en Google

El resumen mensual de la compañía condensa un modelo abierto para laptops con 16 GB de RAM, ventanas flotantes en Android 17 y el estreno del Nano Banana 2 Lite en la API.

Google AI Blog
PEARL de Genesis lidera OpenBind sin ajuste previo

PEARL de Genesis lidera OpenBind sin ajuste previo

El líder del pretraining de Llama 3 dejó Meta por descubrimiento de fármacos: el modelo de difusión de Genesis Molecular acierta el encaje inducido de un target nunca visto antes.

Latent Space
Datacenters orbitales: la promesa de Musk no cuadra

Datacenters orbitales: la promesa de Musk no cuadra

IEEE Spectrum desarma la aritmética detrás de constelaciones de un millón de satélites: 25 años solo para fabricarlos, radiadores gigantes por chip y Kessler al fondo.

IEEE Spectrum AI
Fable 5 alcanza 16% en el índice RLI de tareas freelance

Fable 5 alcanza 16% en el índice RLI de tareas freelance

El benchmark de Scale Labs y el Center for AI Safety mide agentes en 240 proyectos reales por USD 144.000: la tasa top se cuadruplicó en ocho meses.

The Decoder
Meta admite que la apuesta a agentes IA se estancó cuatro meses

Meta admite que la apuesta a agentes IA se estancó cuatro meses

Zuckerberg dijo en un town hall interno que el desarrollo agente no aceleró como esperaba. Su jefe de IA, Alexandr Wang, respondió con el nombre en código del próximo modelo: Watermelon.

The Decoder
Tesla prueba el Cybercab sin volante ni pedales en Austin

Tesla prueba el Cybercab sin volante ni pedales en Austin

La compañía filmó por primera vez la versión de producción biplaza rodando por Austin, con un safety monitor en el asiento del acompañante y un vacío regulatorio a punto de cerrarse a su favor.

TechCrunch
Microsoft unifica Copilot y estrena agentes AutoPilot en agosto

Microsoft unifica Copilot y estrena agentes AutoPilot en agosto

El EVP Jacob Andreou escribió en un memo filtrado a The Information que Microsoft fusiona las apps de consumo y empresa, y suma agentes que hacen agenda y resumen de mail por costo adicional.

The Decoder
PyTorch abre el capó de su infraestructura de tests generados

PyTorch abre el capó de su infraestructura de tests generados

Por qué los nombres que fallan en CI no coinciden con los del código fuente, cómo funciona instantiate_device_type_tests() y cuál es la ruta oficial para reproducir un fallo en local sin adivinar.

PyTorch Blog
AISI británico: benchmarks fijos subestiman a los agentes IA

AISI británico: benchmarks fijos subestiman a los agentes IA

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

The Decoder