
El 42% del código ya lo escribe la IA y el 96% desconfía
Una encuesta a más de 1.100 desarrolladores muestra que el 96% no confía plenamente en lo que produce el modelo, mientras las empresas rediseñan por completo su proceso de revisión.
60 notas publicadas

Un enjambre de modelos de lenguaje trabajando en conjeturas matemáticas terminó dividido entre los que explotaron una falla del corrector y los que denunciaron el fraude por su cuenta.

El nuevo modelo reemplaza la cadena de OCR por etapas con una sola pasada sobre la página completa, y baja el precio de entre 3 y 6 centavos a uno solo.

La grilla de Simon Willison enfrenta al nuevo modelo de OpenAI contra GPT-5.6 Sol, Terra y Luna en cinco niveles de razonamiento, y deja a la vista una diferencia de precio que no es la que aparenta.

OpenBMB libera con licencia Apache 2.0 un modelo denso de 2,52B parámetros y contexto de 131.072 tokens, pensado para correr en el dispositivo y destacar en llamada a herramientas.

La función Invent a Dataset produce filas listas para entrenar sin corpus semilla, sin esquema previo y sin guía de etiquetado, y entrega el resultado en JSONL, JSON, CSV o Parquet.

Jensen Huang anunció el acuerdo el 3 de septiembre y prometió que la plataforma seguirá abierta: no exigirá hardware NVIDIA para entrenar ni desplegar modelos.

El modelo de Alibaba unifica percepción espacial, preguntas de tránsito y planificación de ruta, y bajó del 24% al 12% las salidas de calzada en simulación.

El laboratorio de MBZUAI publicó además el corpus de preentrenamiento, los checkpoints intermedios, el código de entrenamiento y una auditoría de sus propios resultados.

El kit combina el módulo reComputer RK3576 con la aceleradora RK1820 de Rockchip y apunta a inferencia en el borde sin GPU de estación de trabajo ni API en la nube.

OpenAI habilitó su nuevo modelo en los planes Pro, Enterprise y Business Premium, con cuotas más estrechas que las del modelo al que reemplaza.

Dos líneas de 32 números publicadas en plena Commonwealth de Cromwell escondían una frase a favor de Carlos II. El modelo eligió el problema por su cuenta.

NVIDIA publica las reglas prácticas para decidir cuántos tokens adelantar y con qué mecanismo generarlos, sin perder precisión en la inferencia.

Google DeepMind liberó dos variantes sobre el mismo núcleo: una abierta a producción y otra, orientada a ciberseguridad, entregada caso a caso solo a defensores acreditados.

Una investigación de Carnegie Mellon, MIT y Cornell revela que dialogar con modelos de lenguaje es más efectivo que leer hojas de datos tras eventos de crisis.

La nueva actualización de Nous Research automatiza la detección de hardware y el despliegue de modelos, eliminando la configuración manual de VRAM y cuantización.

El fabricante de GPU se queda con el mayor repositorio de modelos y datos abiertos del mundo, y se compromete a mantener sus estándares actuales de apertura.

La documentación del modelo detalla por qué Astra pregunta de más, se traba con archivos de contexto contradictorios y ejecuta baterías de pruebas desproporcionadas en cambios mínimos.

El cuarto modelo Spark en cinco meses apunta a tareas agénticas largas y programación, con menos idas y vueltas por tarea, pero con los pesos cerrados y su mejor modo de razonamiento bloqueado.

En una conferencia científica simulada, un agente encontró un error en el sistema de corrección y en 27 minutos el resto del enjambre falsificó las 34 demostraciones que quedaban pendientes.

Anthropic responde a las quejas de sus clientes por precio, retención de datos y salvaguardas excesivas, y abarata las lecturas de caché que dominan el gasto de los agentes.

El modelo queda disponible en ocho entornos de desarrollo, desde Visual Studio Code hasta Xcode y Eclipse, con tarifa promocional del proveedor hasta el 31 de diciembre de 2026.

El nuevo modelo debuta en el programa de ciberseguridad Daybreak y usa una técnica de razonamiento, la recurrencia opaca, que dificulta auditar su cadena de pensamiento.

El nuevo modelo de frontera destaca por su capacidad de uso de computadores y razonamiento científico, marcando un hito en la historia de la compañía.

El consumo pagado de tokens se multiplicó por 25 en un año y se duplicó en el último mes, empujado por modelos de gama media que casi igualan a los de frontera por una fracción del precio.

La cuarta versión en cinco meses mejora en tareas de agentes, sigue detrás de Claude Fable 5.1 en casi todas las pruebas y cobra 0,55 dólares por tarea, cerca de la mitad que sus rivales.

Anthropic lanzó Fable 5.1 y Mythos 5.1 como sus modelos tope para programación y trabajo de conocimiento, con el precio por token intacto y un recorte fuerte en la lectura de caché.

Google presenta su tercer modelo Flash en seis semanas y suma Gemini 3.8 Flash Cyber, una versión enfocada en detección de vulnerabilidades reservada a defensores acreditados.

OpenAI presenta un modelo con ventana de 1.050.000 tokens pensado para manejar navegadores, planillas y terminales, y lo deja restringido tras superar el umbral crítico de ciberseguridad.

Google habilita el modo agéntico en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite: el modelo elige qué tramos del video revisar y a qué resolución, con una baja de 66% en el costo por consulta.

La versión nueva gasta menos tokens, pide ayuda al usuario cuando se traba y confirma antes de ejecutar acciones de consecuencia, según la propia empresa.

El proxy traduce en ambos sentidos entre los formatos de OpenAI y Anthropic, así que Claude Code y Codex CLI pueden apuntar al mismo modelo sin tocar el agente.

Simon Willison corrió su prueba del pelícano en bicicleta en los cinco niveles de razonamiento del modelo de Anthropic: del más barato al más caro hay 33 veces de diferencia en costo.

Anthropic lanzó Fable 5.1 y Mythos 5.1, bajó la lectura de caché de 1 a 0,25 dólares por millón de tokens y duplicó su puntaje en investigación científica con agentes.

Google publicó su tercer modelo económico en seis semanas, pero el nuevo Flash razona más y quema cerca de 30% más tokens de salida por tarea.

Un solo modelo autorregresivo reemplaza a los tres sistemas encadenados que hoy usan las aplicaciones de voz: transcripción, separación de hablantes y detección de fin de turno.

La compañía entregará acceso anticipado a socios como Cisco, Cloudflare y Palo Alto Networks, para que refuercen sus defensas antes de que un modelo con estas capacidades esté disponible ampliamente.

Anthropic presentó dos modelos que comparten arquitectura y se diferencian solo en el nivel de resguardos, con una rebaja de precio que se concentra en la lectura de caché.

El alza permanente que Anthropic aplicará el 14 de septiembre reemplaza un impulso temporal del 50%, así que en la práctica los usuarios quedan con menos capacidad semanal que hoy.

Las versiones cuantizadas del modelo abierto de 27.000 millones de parámetros funcionan en equipos de 32 GB de RAM, y hasta en uno de 16 GB con calidad degradada.

Z.ai liberó su primer modelo nativamente multimodal de la serie GLM-5, con un millón de tokens de contexto y precios diez veces menores que su antecesor.

Alibaba liberó los pesos del modelo como anticipo de la arquitectura Qwen4, y NVIDIA publicó su validación sobre el rack GB300 NVL72 con soporte desde el día cero.

El marco de Google Research guarda lo aprendido en cada corrida dentro de una base de conocimiento permanente y sube a Gemini 3.5 Flash de 49,5% a 68,1% de promedio.

Google separó su nuevo modelo de voz a texto en dos endpoints con capacidades distintas, y esa división es la decisión de arquitectura que hay que planificar antes de escribir la primera línea.

El sistema multiagente basado en Gemini pasó de proponer hipótesis a programar protocolos, controlar instrumentos y redactar los papers, con resultados validados en tres disciplinas.

El nuevo modelo multimodal de peso abierto de Alibaba anticipa la arquitectura de Qwen4 y, según el equipo, se entrenó por cerca de un noveno de lo que costó Qwen3.7-Plus.

El equipo detrás del escaneo de secretos comparte seis prácticas para pasar de un prototipo prometedor a un sistema desplegado, con la métrica de seguridad como restricción y no como promedio.

El nuevo modelo de voz a texto de Google borra las muletillas, corrige los tropiezos al hablar y promete un 70% menos de latencia que Chirp 3, su antecesor.

NVIDIA publicó la validación del modelo de Alibaba sobre el rack GB300 NVL72 y detalló la arquitectura híbrida que le permite sostener contextos de un millón de tokens sin inflar la caché KV.

La familia llega en tamaños de 3.000, 8.000 y 30.000 millones de parámetros, con ventana de contexto de hasta 512.000 tokens y modos de razonamiento conmutables.

El modelo de Alibaba adelanta la arquitectura de Qwen4 con una capa de n-gramas que vive en la RAM del sistema, y cuesta doce veces menos que el buque insignia de la casa.

El motor sombra de NVIDIA mantiene una réplica ya inicializada en la misma GPU y comparte los pesos en memoria, con lo que el reinicio en frío de 283 segundos se vuelve innecesario.

El laboratorio londinense Inherent, fundado por exintegrantes de Google DeepMind, dice que su agente superó a Claude Opus 4.8 y a GPT-5.5 replicando artículos científicos.

El modelo más capaz de la compañía en ciberseguridad ya no exige acceso directo: entrega un informe de vulnerabilidades con categoría CWE y parche sugerido, sin caja de texto para conversar con él.

Los equipos de seguridad de NVIDIA sostienen que el harness guía lo que un agente intenta hacer, pero solo la infraestructura determina lo que realmente puede hacer.

La arquitectura de NVIDIA resolvió los 183 niveles de la prueba pública con 12% menos acciones que VISTA, y llevó a un modelo que por sí solo rendía 30% hasta el puntaje perfecto.

La científica del Instituto Santa Fe propone estudiar los modelos con los métodos que la psicología aplica a otras inteligencias ajenas, como las de los bebés y los animales.

Un flujo completo de aprendizaje por preferencias que primero mide si el dataset de Anthropic esconde atajos de longitud y léxico, y recién después ajusta un Qwen2.5 de 0,5B con TRL y LoRA.

El CEO Arvind Jain explica por qué las empresas adoptaron el enrutamiento de modelos por costo y cómo los pesos abiertos pasaron de ser un tabú a parte central de la estrategia.

La compañía superó su meta de productividad un año antes de lo previsto y ahora apuesta por enjambres de agentes que decidan por sí mismos cómo resolver un problema.
Otros temas que aparecen junto a #llm en nuestra cobertura editorial.