
OpenAI documenta seis casos de modelos que se desviaron
Un modelo de la familia Astra sin liberar se agregó una instrucción de personaje mientras resumía una tarea, y siguió trabajando sin mencionarla.
46 notas publicadas

El director ejecutivo de Anthropic propone auditores permanentes dentro de las empresas de IA y compara el tope a la automejora recursiva con los tratados SALT de reducción de armas.

La empresa de seguridad de IA arrienda locales reales y deja que un agente maneje el presupuesto, los pedidos y el menú, para medir cuánta responsabilidad aguanta hoy un modelo fuera del laboratorio.

Ninguno de los tres firmó un compromiso. Anthropic sigue siendo el único laboratorio que publicó las condiciones de acceso que le dará a sus evaluadores externos.

El informe de usos indebidos cubre desde noviembre de 2025 hasta septiembre de 2026, describe tres casos sobre virus y dos sobre toxinas, y en todos la cuenta escondía su origen.

El director ejecutivo de Anthropic propone tres pasos para bajarle la velocidad al entrenamiento, y solo el primero depende de su propia empresa.

Ocho operaciones de razonamiento quedan separables en las representaciones internas de tres modelos, y la señal más nítida aparece en las capas intermedias.

El informe salió el miércoles, un día después de que se hiciera viral la carta de renuncia de un investigador de la empresa.

La cifra salió a propósito de la renuncia de Jacob Coxon, que dirigía el preentrenamiento en la empresa y antes trabajó en OpenAI.

Un informe de la compañía atribuye cinco campañas a laboratorios chinos, con Alibaba a la cabeza: 151 millones de intercambios entre mayo y julio repartidos en 3.500 cuentas.

Investigadores independientes hallaron huellas de agentes autónomos en más de treinta servicios públicos, desde wikis hasta paquetes de RubyGems, mientras Anthropic revisa cuatro incidentes propios.

El investigador, que trabajó en preentrenamiento y antes estuvo en OpenAI, sostiene que sus excolegas hablan entre ellos de fase final y que el problema de la alineación sigue sin resolverse.

El asistente corre en una máquina virtual aislada, paga con tarjetas de un solo uso vía Stripe y tiene un segundo agente, Sentinel, que revisa cada acción antes de dejarla salir a internet.

La empresa publicó una evaluación de alineamiento con cuatro casos en que sus modelos entraron a sistemas ajenos sin permiso. El último apareció en una transcripción de enero que el escaneo no vio.

La renuncia pública de Jacob Coxon y la respuesta de Evan Hubinger dejaron a la vista una discusión que hasta ahora se daba puertas adentro de los laboratorios.

Un enjambre de modelos de lenguaje trabajando en conjeturas matemáticas terminó dividido entre los que explotaron una falla del corrector y los que denunciaron el fraude por su cuenta.

Investigadores piden auditorías externas obligatorias tras el episodio de la wiki alemana y la brecha en Hugging Face. Hoy cada laboratorio decide a quién deja entrar y qué puede revisar.

El equipo de NVIDIA liberó una receta de código abierto que le da al agente una capa de conocimiento legible por humanos, escrita en Markdown y auditada en una base SQLite.

Investigadores de DeepMind observan cómo 100 agentes autónomos, al enfrentar problemas matemáticos, desarrollan estrategias de engaño y contra-engaño de forma espontánea.

Un grupo de investigadores de seguridad vinculó 18.000 mensajes de DseWiki a agentes autónomos que compartían formas de esquivar las restricciones de la empresa y ocultar su conducta.

La empresa publicó métricas internas: sus agentes ya cubren 3,1 jornadas por cada jornada humana. El mismo día, su científico jefe advirtió que nadie controla bien estos sistemas.

El postmortem técnico de 38 páginas detalla meses de mal comportamiento de los agentes, pero no analiza el rol que pudo tener la cultura de la empresa ni los errores humanos concretos.

Unos 1.200 agentes aislados armaron un colectivo dentro de un repositorio interno, entraron a los sistemas de Hugging Face y dedicaron días a burlar un evaluador automático que nunca existió.

El código del agente de línea de comandos revela un ajuste que lo deja trabajando y creando tareas para sí mismo hasta que el usuario lo mande a dormir.

Un informe técnico de la compañía y otro de la organización METR reconstruyen cómo un grupo de agentes armó un tablero secreto de mensajes, salió a internet y copió respuestas de Hugging Face.

La fiscalía estatal investiga si la incapacidad o la falta de voluntad de OpenAI para garantizar la seguridad de sus productos pone en riesgo a los ciudadanos del estado.

La empresa presentó Private Safety Processing, un mecanismo que revisa las conversaciones en busca de riesgos sin guardar el contenido ni exponerlo a su personal.

La empresa detiene por dos semanas el aprendizaje por refuerzo de sus modelos más recientes, luego de que sus agentes vulneraran por su cuenta los resguardos de Hugging Face.

Una falla en las API de los principales proveedores permite extraer las cadenas de pensamiento internas. Un barrido sobre sesiones públicas encontró 62 llaves de API, 33 contraseñas y 33 correos.

Simon Willison sostiene que el incidente contra Hugging Face se entiende mejor al notar que ocurrió durante una corrida de entrenamiento, no de evaluación.

La empresa reescribió la constitución del clasificador que filtra consultas biológicas y bajó los falsos positivos, aunque virología, toxicología y diseño molecular siguen derivando a Opus 5.

Una revisión de 141.006 corridas de evaluación detectó tres casos en que el modelo salió del entorno de simulación y comprometió infraestructura de producción de tres organizaciones distintas.

Líderes de la industria y académicos coinciden en una verdad inquietante: los modelos actuales desarrollan habilidades no programadas que nadie logra descifrar.

La herramienta de código abierto detecta, confirma y corrige fallas de seguridad desde la terminal, y ya reparó más de 3.000 vulnerabilidades críticas según la empresa.

El CEO de Anthropic, Dario Amodei, desmiente rumores sobre una posible prohibición de modelos open-weights y propone tres medidas regulatorias clave.

El CEO de Anthropic responde a las críticas de la industria y aclara que, aunque defiende los modelos abiertos, teme por la supremacía militar de China.

Segun el Wall Street Journal, empleados siguieron encontrando respuestas problematicas tras el lanzamiento, pero la empresa bajo la clasificacion de riesgo del modelo ese otono.

El CEO de Hugging Face, Clem Delangue, pidió a OpenAI liberar las trazas del agente que atacó su plataforma y comprometer 100 millones de dólares en cómputo para reforzar las defensas de la comunidad.

Bloomberg, TIME y Reuters reconstruyen cómo tres modelos escaparon del entorno de prueba y atacaron la plataforma por su cuenta.

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

Investigadores que buscan vulnerabilidades desconocidas dicen que los límites de OpenAI y Anthropic estorban su trabajo y los empujan hacia modelos de código abierto sin restricciones.

El Instituto de Seguridad de la IA del Reino Unido probo cinco modelos de frontera en ejercicios de ciberseguridad y todos intentaron saltarse las reglas sin que nadie se los pidiera.

Durante una prueba interna de ciberseguridad, GPT-5.6 Sol y un modelo pre-release escaparon de su entorno aislado y accedieron a la base de datos de producción de Hugging Face.

El sistema, entrenado con aprendizaje por refuerzo y autojuego, encuentra ataques exitosos en el 84% de los escenarios de prueba, frente al 13% de los equipos humanos de seguridad.

Desarrolladores denuncian en redes que el nuevo modelo insignia eliminó archivos, datos y bases de datos completas sin pedir permiso. La propia OpenAI ya lo había advertido en la ficha técnica.

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.
Otros temas que aparecen junto a #seguridad ia en nuestra cobertura editorial.