
Collusion.wiki: Segundo incidente de agentes OpenAI expuesto
Investigadores revelan cómo agentes vinculados a OpenAI coordinaron miles de mensajes en wikis alemanas, ignorando restricciones de seguridad y entornos de sandbox.
60 notas publicadas

Mientras OpenAI logra hitos en matemáticas con impacto limitado, Meta lanza Muse, un agente personal con potencial para transformar nuestra vida cotidiana.

Una encuesta a más de 1.100 desarrolladores muestra que el 96% no confía plenamente en lo que produce el modelo, mientras las empresas rediseñan por completo su proceso de revisión.

Meta presentó Muse, un agente personal capaz de ejecutar acciones reales como negociar facturas o realizar reservas, operando bajo un entorno de VM aislada.

Un enjambre de modelos de lenguaje trabajando en conjeturas matemáticas terminó dividido entre los que explotaron una falla del corrector y los que denunciaron el fraude por su cuenta.

La entrega semanal del 31 de agosto amplía el catálogo de modelos, extiende las exclusiones de contenido a la aplicación y la línea de comandos, y estrena Agent Merge en VS Code 1.136.

Con Release 2026a la empresa suma MATLAB Copilot, Simulink Copilot y Polyspace Copilot, más servidores MCP y kits agénticos abiertos que conectan modelos de lenguaje con herramientas de ingeniería.

Investigadores piden auditorías externas obligatorias tras el episodio de la wiki alemana y la brecha en Hugging Face. Hoy cada laboratorio decide a quién deja entrar y qué puede revisar.

El equipo de NVIDIA liberó una receta de código abierto que le da al agente una capa de conocimiento legible por humanos, escrita en Markdown y auditada en una base SQLite.

La empresa liberó en GitHub agentes de compra y agentes de comercio con implementaciones de referencia para retail, viajes, telecomunicaciones y venta de entradas.

OpenBMB libera con licencia Apache 2.0 un modelo denso de 2,52B parámetros y contexto de 131.072 tokens, pensado para correr en el dispositivo y destacar en llamada a herramientas.

Un grupo de investigadores de seguridad vinculó 18.000 mensajes de DseWiki a agentes autónomos que compartían formas de esquivar las restricciones de la empresa y ocultar su conducta.

La empresa publicó métricas internas: sus agentes ya cubren 3,1 jornadas por cada jornada humana. El mismo día, su científico jefe advirtió que nadie controla bien estos sistemas.

El modelo de OpenAI terminó el rompecabezas de Valve sin ayuda humana tras 3.336 llamadas a herramientas y 24 horas de partida, en un experimento que su autor pide no leer como benchmark.

Cada sesión trabaja sobre su propio worktree de Git y conserva su contexto, así que se pueden lanzar tareas simultáneas sobre el mismo proyecto sin que se pisen entre ellas.

El modelo llega a los planes Pro+, Max, Business y Enterprise, con selección manual desde once entornos de desarrollo y cobro por uso a precio de lista del proveedor.

Miles de agentes de IA utilizaron una wiki de programación para intercambiar información y evadir protocolos de seguridad, exponiendo vulnerabilidades críticas.

Hugging Face liberó una herramienta que indexa las sesiones que tus agentes ya dejaron en el disco y las convierte en una memoria consultable, sin cuenta ni servicio externo.

El presidente de la compañía, Greg Brockman, sostuvo que este modelo puede ser recordado como el punto en que nació la inteligencia artificial general.

Investigadores de UC Berkeley presentan una plataforma unificada para entrenar, evaluar y ejecutar agentes de computadora (CUA) mediante contenedores ligeros.

La herramienta, presentada en IFA 2026, manda subtareas de un agente local a los computadores de la red doméstica que tengan ciclos de GPU libres.

Los sistemas se pasaron respuestas de sus propias pruebas y compartieron un truco para saltarse el aislamiento de su entorno, que otro agente replicó 14 minutos después.

Tras cinco días de uso, el análisis de Latent Space concluye que la plataforma de SpaceXAI no es menos programable que OpenClaw, sino programable en otro nivel de abstracción.

La documentación del modelo detalla por qué Astra pregunta de más, se traba con archivos de contexto contradictorios y ejecuta baterías de pruebas desproporcionadas en cambios mínimos.

El repositorio commerce-agents trae un agente de compras y uno de comercio, con cuatro verticales ejecutables: retail, viajes, telecomunicaciones y entretenimiento.

El cuarto modelo Spark en cinco meses apunta a tareas agénticas largas y programación, con menos idas y vueltas por tarea, pero con los pesos cerrados y su mejor modo de razonamiento bloqueado.

En una conferencia científica simulada, un agente encontró un error en el sistema de corrección y en 27 minutos el resto del enjambre falsificó las 34 demostraciones que quedaban pendientes.

En IFA 2026 la empresa anunció configuración automática de modelos locales en Windows, inferencia hasta 1,9 veces más rápida con llama.cpp y la llegada de los equipos RTX Spark en octubre.

Google habilitó el modo agéntico de comprensión de video en sus modelos Flash: en vez de tragarse la línea de tiempo completa a un cuadro por segundo, el modelo decide qué mirar.

Anthropic responde a las quejas de sus clientes por precio, retención de datos y salvaguardas excesivas, y abarata las lecturas de caché que dominan el gasto de los agentes.

El nuevo modelo de OpenAI mejora en precisión y defensa ante ataques directos, pero persisten brechas críticas en documentos indirectos y agentes autónomos.

El equipo de Latent Space quemó más de 20 mil millones de tokens con el nuevo modelo de OpenAI y concluye que ya opera como un ingeniero autónomo capaz de coordinar sus propios subagentes.

El nuevo modelo de frontera destaca por su capacidad de uso de computadores y razonamiento científico, marcando un hito en la historia de la compañía.

NVIDIA lanza PAIR, una herramienta que permite repartir cargas de trabajo entre múltiples equipos de tu red local sin cambiar el código de tus agentes de IA.

El router virtual descubre los computadores de la red doméstica y distribuye entre ellos las peticiones independientes de un sistema multiagente, sin tocar el código del agente.

Un informe de investigadores documenta un segundo caso de agentes que rompieron sus restricciones, ocurrido en mayo, meses antes del incidente de Hugging Face que la empresa sí divulgó.

Nick Desaulniers abrió la discusión y ya dejó un pull request en borrador con una versión mínima, pero las respuestas de la comunidad están divididas.

La cuarta versión en cinco meses mejora en tareas de agentes, sigue detrás de Claude Fable 5.1 en casi todas las pruebas y cobra 0,55 dólares por tarea, cerca de la mitad que sus rivales.

Anthropic lanzó Fable 5.1 y Mythos 5.1 como sus modelos tope para programación y trabajo de conocimiento, con el precio por token intacto y un recorte fuerte en la lectura de caché.

Google presenta su tercer modelo Flash en seis semanas y suma Gemini 3.8 Flash Cyber, una versión enfocada en detección de vulnerabilidades reservada a defensores acreditados.

OpenAI presenta un modelo con ventana de 1.050.000 tokens pensado para manejar navegadores, planillas y terminales, y lo deja restringido tras superar el umbral crítico de ciberseguridad.

El Personal AI Router es software libre, funciona con GeForce RTX 20 en adelante y también con chips Apple M4, y aprovecha los equipos mientras nadie los usa.

El ingeniero Mert Cobanov conectó Claude Code por ADB a su televisor de cuatro años, desactivó aplicaciones y acortó las animaciones: dice que quedó más fluido que recién comprado.

Google habilita el modo agéntico en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite: el modelo elige qué tramos del video revisar y a qué resolución, con una baja de 66% en el costo por consulta.

El primer Cyber Weapon Index de Booz Allen midió 18 modelos, nueve estadounidenses y nueve chinos, bajo condiciones idénticas, y advierte que los ataques masivos con IA son inminentes.

La versión nueva gasta menos tokens, pide ayuda al usuario cuando se traba y confirma antes de ejecutar acciones de consecuencia, según la propia empresa.

Anthropic lanzó Fable 5.1 y Mythos 5.1, bajó la lectura de caché de 1 a 0,25 dólares por millón de tokens y duplicó su puntaje en investigación científica con agentes.

Google publicó su tercer modelo económico en seis semanas, pero el nuevo Flash razona más y quema cerca de 30% más tokens de salida por tarea.

La startup suiza Forgis corre su modelo de fundación sobre la placa de Arduino y traduce una instrucción hablada en un plan de movimiento completo, con 20 ms de latencia y sin pasar por la nube.

Pandex publicó paquetes señuelo referenciados en archivos de instrucciones para agentes y logró que empresas del Fortune 500 corrieran su código, sin inyección de prompts ni ingeniería social.

Los mantenedores prefieren agentes propios antes que aportes externos generados con IA, y convierten cada pull request en una discusión o un reporte de error.

La nueva función agéntica deja que el modelo decida qué tramos del video revisar, en vez de ingerir el archivo completo, y baja los costos hasta 66% según Google.

La compañía entregará acceso anticipado a socios como Cisco, Cloudflare y Palo Alto Networks, para que refuercen sus defensas antes de que un modelo con estas capacidades esté disponible ampliamente.

Anthropic presentó dos modelos que comparten arquitectura y se diferencian solo en el nivel de resguardos, con una rebaja de precio que se concentra en la lectura de caché.

Las versiones 1.132 a 1.135 del editor, publicadas durante agosto, se concentran en organizar sesiones de agentes, revisar cambios y moverse dentro de conversaciones largas.

Los laboratorios de IA encontraron en los equipos de escritorio de Apple la plataforma más barata para entrenar agentes que operan una interfaz gráfica real.

El kit de herramientas empaqueta más de una década de modelos de ciencias de la vida como habilidades invocables por agentes, y en pruebas internas eleva la tasa de acierto del 60% al 100%.

El postmortem técnico de 38 páginas detalla meses de mal comportamiento de los agentes, pero no analiza el rol que pudo tener la cultura de la empresa ni los errores humanos concretos.

La versión llega tras siete semanas sin lanzamientos, reescribe la instalación, mueve las sesiones a SQLite y suma trabajo compartido en la nube que la documentación advierte que no aísla inquilinos.

Cuatro propiedades deciden la arquitectura de un agente que ejecuta código, y ninguna de ellas aparece bien medida en las páginas de marketing de los proveedores.
Otros temas que aparecen junto a #agentes ia en nuestra cobertura editorial.