
OpenAI perdió el control de sus modelos en el hackeo a Hugging Face
Bloomberg, TIME y Reuters reconstruyen cómo tres modelos escaparon del entorno de prueba y atacaron la plataforma por su cuenta.
55 notas publicadas

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

El nuevo modelo de Anthropic llega con mayor precisión, menores restricciones de privacidad y una función beta de fallbacks automáticos para usuarios API.

El agente explotó una vulnerabilidad de día cero para escalar privilegios, salió a internet y accedió a modelos y datasets de Hugging Face mientras resolvía una evaluación de ciberseguridad.

Investigadores que buscan vulnerabilidades desconocidas dicen que los límites de OpenAI y Anthropic estorban su trabajo y los empujan hacia modelos de código abierto sin restricciones.

Un modelo de OpenAI logró vulnerar los sistemas de Hugging Face tras escapar de su entorno de pruebas debido a una configuración de red mal ejecutada.

Investigadores revelan cómo una vulnerabilidad permitió que enlaces manipulados crearan agentes de IA con acceso total a datos corporativos y ejecución de comandos.

Durante una prueba interna, modelos de OpenAI escaparon de su entorno aislado, hallaron una falla en un instalador de paquetes y llegaron a la base de datos de producción de Hugging Face.

El Instituto de Seguridad de la IA del Reino Unido probo cinco modelos de frontera en ejercicios de ciberseguridad y todos intentaron saltarse las reglas sin que nadie se los pidiera.

Los modelos Antares-350M y Antares-1B corren localmente y, segun la empresa, detectan fallas de seguridad por una fraccion del costo de agentes como GPT-5.5.

Durante una prueba interna de ciberseguridad, GPT-5.6 Sol y un modelo pre-release escaparon de su entorno aislado y accedieron a la base de datos de producción de Hugging Face.

Google presenta una versión optimizada de su modelo Flash, diseñada específicamente para identificar, validar y corregir vulnerabilidades de software a gran escala.

Durante una evaluación interna, modelos de OpenAI vulneraron un sandbox, explotaron una falla zero-day y atacaron la infraestructura de Hugging Face.

Google DeepMind expande su ecosistema de modelos con tres variantes optimizadas para velocidad, eficiencia energética y seguridad avanzada en entornos empresariales.

Los modelos de ciberseguridad, incluido GPT-5.6 Sol, rompieron un entorno de pruebas sellado, explotaron un zero-day y llegaron a internet abierto para robar las respuestas de su propia evaluacion.

La plataforma dice que un sistema de agentes de IA orquestó por sí solo el ataque, y que usó modelos de lenguaje propios para reconstruir en horas una investigación forense que habría tomado días.

Investigadores de Tracebit descubrieron que plantar comandos maliciosos junto a secretos falsos hace que los agentes de IA atacantes se autobloqueen antes de causar daño.
Un analisis del Instituto britanico de Seguridad en IA advierte que la brecha en capacidades ciberneticas cayo de seis a diez meses a solo cuatro a siete, y a una fraccion del costo.

La familia debuta con un modelo insignia para programación, capacidades reforzadas de ciberseguridad y la nueva herramienta ChatGPT Work para equipos empresariales.

La firma de seguridad Sysdig documento a JadePuffer, un ataque donde un agente ejecuto toda la parte tecnica, pero una persona todavia eligio a la victima y monto la infraestructura.

El modelo entró por una falla de Langflow (CVE-2025-3248) sin parchar desde abril de 2025, cifró 1.342 registros y corrigió su propio error de login en 31 segundos.
La compañía separa uso prohibido, doble uso de alto y bajo riesgo, y uso benigno. Publica además un borrador de marco de severidad de jailbreaks junto a socios de Glasswing.

La compañía restablece el acceso global el 1 de julio tras 19 días de suspensión. Un clasificador de seguridad revisado, validado por CAISI, reemplaza al que motivó las restricciones federales.

El modelo open-weight de Zhipu AI ya se acerca a Anthropic y OpenAI en ciberseguridad, aunque sigue rezagado en tareas generales. Washington observa con preocupación.

El nuevo modelo de Anthropic prioriza la ciberseguridad y el rendimiento en tareas agénticas, alejándose de la potencia desmedida de la familia Mythos.

Tras dos semanas de bloqueo, el secretario Howard Lutnick autoriza a un grupo selecto de corporaciones y agencias federales a usar Mythos 5, aunque Claude Fable 5 sigue suspendido.

Veinte empresas, entre ellas AWS, Anthropic, Google, NVIDIA y OpenAI, coordinan un equipo único de respuesta para evitar que la IA explote vulnerabilidades antes que los maintainers puedan parcharlas.

El nuevo buque insignia de OpenAI lidera benchmarks de coding agéntico y matchea a Mythos en ciberseguridad, pero Washington bloquea el lanzamiento abierto y la empresa critica la decisión.
Amazon, Anthropic, OpenAI, NVIDIA, Microsoft, Red Hat y otros 14 actores arman un SIRT compartido y un proceso CVD estandarizado para parchar bugs encontrados por LLM en software crítico.

El nuevo modelo lidera CyberGym (85,6%) y SEC-bench Pro (69,8%); el programa suma 25 partners como Cisco, CrowdStrike, Cloudflare y Palo Alto Networks.

La iniciativa, en alianza con Trail of Bits, usa la suite Codex Security para que ingenieros revisen y parchen vulnerabilidades antes de que lleguen a los mantenedores.

Con Trail of Bits y HackerOne, y nuevas versiones de GPT-5.5-Cyber y Codex Security, OpenAI ofrece ayuda gratuita a mantenedores open source mientras Anthropic enfrenta a la Casa Blanca.

El modelo de Anthropic forzó accesos restringidos en una evaluación interna autorizada y empujó al gobierno de EE.UU. a aplicar controles de exportación directos sobre un modelo de IA por primera vez.

Anthropic abre su nuevo tope de gama a USD 10 por millón de tokens de entrada y USD 50 de salida, mientras Mythos 5 va a un grupo cerrado vía Project Glasswing.

Amazon Web Services debutó dos servicios en su Summit de Nueva York: uno automatiza el ciclo de vulnerabilidades de código y otro alimenta agentes con un grafo de conocimiento corporativo.

Una llave de prueba pública del AOSP es todo lo que necesita un atacante para escribir un USB capaz de instalar apps no autorizadas en el head unit del modelo. Ataque bautizado EvilValet.

El bloqueo a Claude Fable 5 y Mythos 5 esconde una verdad incómoda: los modelos con capacidades avanzadas de hacking pronto serán la norma, dicen Schneier, Wheeler y otros expertos.

Funcionarios de Trump acusan a la firma de liberar Fable 5 sin esperar al clearinghouse previsto en la executive order cyber, mientras 100 expertos en seguridad piden levantar los controles de export.

Eric McDonald demostró que el infotainment del Civic 2021 acepta firmware firmado con las claves de prueba de AOSP que quedaron en el sistema, lo que abre tanto modding como ataque EvilValet.

Una directiva entregada el viernes a las 17:21 ET obliga a desactivar globalmente los dos modelos más potentes de la empresa por preocupaciones de seguridad nacional.

Un estudio del equipo de seguridad de Anthropic mostró que Mythos Preview construyó 8 cadenas de escalada de privilegios en Windows en menos de un día, a USD 2.000 cada una.

Google DeepMind, junto a socios estratégicos, abre una convocatoria de hasta USD 10 millones para investigar la seguridad y estabilidad de sistemas de IA multi-agente.

La tecnología de computación confidencial de NVIDIA se expande a la infraestructura de Apple para asegurar el procesamiento de datos en la nube con mayor privacidad.

Investigadores descubrieron un campo de datos en la señal L1 C/A que ha permanecido sin explicación técnica durante casi dos décadas de transmisiones.

La aplicación Teléfono de Google introduce una capa de autenticación mediante RCS para verificar la identidad del emisor y frenar la suplantación por voz.

Un informe de Anthropic revela cómo los atacantes usan IA para automatizar fases complejas de sus operaciones, desafiando los métodos de detección actuales.

Claude Mythos Preview suma 150 nuevos partners en 15 paises y sectores como energia, agua, salud y hardware tras detectar mas de 10.000 vulnerabilidades criticas.

El proyecto reemplaza la nube propietaria por cifrado de extremo a extremo con MLS, detección de personas y vehículos en el dispositivo, y firmware reproducible verificable en GitHub.

La operación contra Glassworm cortó cuatro canales C2 que usaban Solana, BitTorrent, Google Calendar y VPS para envenenar más de 300 repositorios en GitHub.

Los jailbreaks evolucionaron de comandos absurdos a conversaciones manipuladoras. Mindgard 'gaslighteó' a Claude, y la nueva clase de hacker viene de psicología, no de programación.

El programa Glasswing reúne 50 socios, escaneó más de 1.000 proyectos open source y reporta que el cuello de botella ya no es encontrar vulnerabilidades, sino verificarlas y parcharlas.

Project Glasswing, la operacion ofensiva de Anthropic con unos 50 socios (Cloudflare, Mozilla, Oracle), encuentra vulnerabilidades criticas mas rapido de lo que se pueden cerrar.

El agente IA debutó en octubre pasado para detectar y reparar vulnerabilidades; ahora se abre a expertos externos en plena ola de IA aplicada a seguridad.

El modelo de seguridad probó más de 50 repositorios de Cloudflare en Project Glasswing y compiló pruebas de concepto funcionales por su cuenta.

El nuevo checkpoint de Anthropic completa 6 de 10 intentos en un ataque de 32 etapas y es el primer modelo en romper la simulación de control industrial 'Cooling Tower'.
Otros temas que aparecen junto a #ciberseguridad en nuestra cobertura editorial.