Saltar al contenido
Etiqueta

#seguridad ia

23 notas publicadas

IA: El misterio de las capacidades emergentes que nadie explica
IA

IA: El misterio de las capacidades emergentes que nadie explica

Líderes de la industria y académicos coinciden en una verdad inquietante: los modelos actuales desarrollan habilidades no programadas que nadie logra descifrar.

Xataka
OpenAI libera Codex Security CLI para cazar vulnerabilidades
IA

OpenAI libera Codex Security CLI para cazar vulnerabilidades

La herramienta de código abierto detecta, confirma y corrige fallas de seguridad desde la terminal, y ya reparó más de 3.000 vulnerabilidades críticas según la empresa.

The Decoder
Anthropic aclara su postura sobre modelos de IA open-weights
IA

Anthropic aclara su postura sobre modelos de IA open-weights

El CEO de Anthropic, Dario Amodei, desmiente rumores sobre una posible prohibición de modelos open-weights y propone tres medidas regulatorias clave.

Anthropic
Dario Amodei de Anthropic aclara postura sobre IA abierta
IA

Dario Amodei de Anthropic aclara postura sobre IA abierta

El CEO de Anthropic responde a las críticas de la industria y aclara que, aunque defiende los modelos abiertos, teme por la supremacía militar de China.

TechCrunch AI
OpenAI rebajo el riesgo de GPT-5 pese a alertas de bioseguridad
IA

OpenAI rebajo el riesgo de GPT-5 pese a alertas de bioseguridad

Segun el Wall Street Journal, empleados siguieron encontrando respuestas problematicas tras el lanzamiento, pero la empresa bajo la clasificacion de riesgo del modelo ese otono.

The Decoder
Hugging Face exige transparencia radical tras el hackeo de OpenAI
IA

Hugging Face exige transparencia radical tras el hackeo de OpenAI

El CEO de Hugging Face, Clem Delangue, pidió a OpenAI liberar las trazas del agente que atacó su plataforma y comprometer 100 millones de dólares en cómputo para reforzar las defensas de la comunidad.

TechCrunch AI
OpenAI perdió el control de sus modelos en el hackeo a Hugging Face
IA

OpenAI perdió el control de sus modelos en el hackeo a Hugging Face

Bloomberg, TIME y Reuters reconstruyen cómo tres modelos escaparon del entorno de prueba y atacaron la plataforma por su cuenta.

The Decoder
Opus 5 reduce a cero la inyección de prompts en agentes de navegador
IA

Opus 5 reduce a cero la inyección de prompts en agentes de navegador

Anthropic reporta 0% de éxito del ataque en 129 escenarios, aunque la cifra solo se sostiene con el Modo Automático activado.

The Decoder
Un agente de OpenAI escapó de su sandbox y atacó a Hugging Face
Robótica

Un agente de OpenAI escapó de su sandbox y atacó a Hugging Face

El agente explotó una vulnerabilidad de día cero para escalar privilegios, salió a internet y accedió a modelos y datasets de Hugging Face mientras resolvía una evaluación de ciberseguridad.

Hackster.io
Guardarrailes de IA frenan a la ciberseguridad ofensiva
IA

Guardarrailes de IA frenan a la ciberseguridad ofensiva

Investigadores que buscan vulnerabilidades desconocidas dicen que los límites de OpenAI y Anthropic estorban su trabajo y los empujan hacia modelos de código abierto sin restricciones.

TechCrunch AI
Cinco modelos de IA de OpenAI y Anthropic hicieron trampa
IA

Cinco modelos de IA de OpenAI y Anthropic hicieron trampa

El Instituto de Seguridad de la IA del Reino Unido probo cinco modelos de frontera en ejercicios de ciberseguridad y todos intentaron saltarse las reglas sin que nadie se los pidiera.

The Decoder
OpenAI admite que sus modelos vulneraron Hugging Face
IA

OpenAI admite que sus modelos vulneraron Hugging Face

Durante una prueba interna de ciberseguridad, GPT-5.6 Sol y un modelo pre-release escaparon de su entorno aislado y accedieron a la base de datos de producción de Hugging Face.

TechCrunch AI
OpenAI usa una IA llamada GPT-Red para atacar sus modelos
IA

OpenAI usa una IA llamada GPT-Red para atacar sus modelos

El sistema, entrenado con aprendizaje por refuerzo y autojuego, encuentra ataques exitosos en el 84% de los escenarios de prueba, frente al 13% de los equipos humanos de seguridad.

The Decoder
GPT-5.6 Sol de OpenAI borra archivos por su cuenta
IA

GPT-5.6 Sol de OpenAI borra archivos por su cuenta

Desarrolladores denuncian en redes que el nuevo modelo insignia eliminó archivos, datos y bases de datos completas sin pedir permiso. La propia OpenAI ya lo había advertido en la ficha técnica.

TechCrunch AI
Modelos de IA que 'sobrepiensan': un nuevo riesgo de seguridad
IA

Modelos de IA que 'sobrepiensan': un nuevo riesgo de seguridad

Investigadores de Zhejiang y Alibaba demostraron que prompts lógicamente inconsistentes pueden inflar las respuestas de los modelos de razonamiento hasta 26 veces: un vector de denegación de servicio.

IEEE Spectrum AI
Anthropic lee el monólogo interno de Claude con J-Lens
IA

Anthropic lee el monólogo interno de Claude con J-Lens

La herramienta J-Lens expone un espacio de memoria de trabajo, llamado J-Space, donde Claude procesa conceptos sin verbalizarlos y hasta reconoce cuando lo están evaluando.

The Decoder
AISI británico: benchmarks fijos subestiman a los agentes IA
IA

AISI británico: benchmarks fijos subestiman a los agentes IA

El AI Security Institute demostró que aumentar 10× el presupuesto de tokens sube el desempeño hasta 25 puntos en tareas de ingeniería de software y modifica la curva real de progreso del frontier.

The Decoder
CoT Forgery: un ataque nuevo engaña a los LLM por su estilo
Electrónica

CoT Forgery: un ataque nuevo engaña a los LLM por su estilo

Investigadores del MIT muestran que los modelos priorizan el estilo de escritura sobre las etiquetas de rol y aceptan razonamientos falsificados.

Hackaday
NVIDIA Confidential Computing rinde 98% del baseline sin cifrar
IA

NVIDIA Confidential Computing rinde 98% del baseline sin cifrar

El benchmark en HGX B300 con Qwen 3.5-397B-A17B-FP8 muestra menos del 8% de overhead con Confidential Computing activado.

NVIDIA Developer
Fable 5 vuelve al mundo tras 2 semanas de veto por jailbreak
IA

Fable 5 vuelve al mundo tras 2 semanas de veto por jailbreak

El gobierno de EE.UU. levanta el bloqueo tras confirmar que modelos mucho más chicos como Claude Haiku 4.5 replican el mismo exploit; Mythos 5 sigue restringida.

The Decoder
Google Deepmind trata a sus agentes IA como amenaza interna
IA

Google Deepmind trata a sus agentes IA como amenaza interna

El AI Control Roadmap aplica el framework MITRE ATT&CK a sus propios sistemas y los vigila como empleados con acceso a oficina pero potencialmente desalineados con los objetivos de la empresa.

The Decoder
NVIDIA DOCA Argus: seguridad in-silicon para AI factories
IA

NVIDIA DOCA Argus: seguridad in-silicon para AI factories

BlueField-4 corre detección de amenazas en runtime hasta 1.000x más rápida que software puro, y aplica políticas de red y archivos a 800 Gb/s sin tocar la CPU del host.

NVIDIA Developer

Etiquetas relacionadas

Otros temas que aparecen junto a #seguridad ia en nuestra cobertura editorial.