Eliminar filtros de seguridad en modelos de IA es ahora un servicio comercial

Abliteration.ai, una startup estadounidense, elimina los mecanismos de rechazo entrenados en modelos de peso abierto y vende acceso a estas versiones modificadas como un servicio. Aunque existe un mercado legítimo para esta herramienta, la configuración actual genera un complejo dilema de seguridad.

Cualquier persona con acceso a los pesos de un modelo de peso abierto puede modificar sus mecanismos de seguridad entrenados. La startup Abliteration.ai ha construido un modelo de negocio precisamente sobre esta premisa. A finales de agosto, lanzaron "abliterated-model-large-v2", una versión modificada del modelo GLM-5.3 de Z.AI, diseñado para rechazar solicitudes sensibles con mucha menos frecuencia.

La técnica se denomina "abliteración". En términos simples, el proceso identifica patrones de activación internos en el modelo que provocan las respuestas de rechazo. Luego, los pesos del modelo se ajustan para suprimir dichos patrones. Esto no es un jailbreak mediante prompts, sino una alteración del modelo en sí mismo. Abliteration.ai asegura que las capacidades de programación, ciberseguridad y agentes se mantienen mayormente intactas.

Abliteration.ai compara su modelo GLM-5.3 abliterado con modelos competidores a través de tres benchmarks. Las evaluaciones internas de la empresa buscan respaldar sus afirmaciones. Para la versión de GLM-5.3 modificada, Abliteration.ai reporta un 84,5% en CyberGym, un 41,8% en Terminal-Bench 4.0 y 105 tareas de ExploitGym resueltas en dos horas. No obstante, el modelo no lidera en todas las categorías. En la tabla proporcionada por la empresa, GPT-5.5 encabeza CyberGym con un 85,6%, y modelos como GPT-5.6 Sol y Fable 5 obtienen puntuaciones superiores en ExploitGym. Abliteration.ai reconoce que los puntajes provienen de diferentes entornos y presupuestos de cómputo, lo que limita la comparación directa.

¿Por qué elegir GLM para la abliteración?

El modelo predecesor, "abliterated-model-large", también se basaba en GLM-5.2. Según Abliteration.ai, las versiones anteriores de GLM fueron entrenadas deliberadamente de formas que dificultaban su uso en tareas prácticas de seguridad. Z.AI ha señalado que las capacidades cibernéticas de GLM-5.3 crecieron más rápido de lo esperado durante el post-entrenamiento.

GLM combina un alto rendimiento en codificación, agentes y ciberseguridad con pesos abiertos y una licencia de uso comercial. Existen alternativas provenientes de Qwen, DeepSeek y Mistral. Z.AI permite modificaciones, derivados y ofertas comerciales de "Modelo como Servicio" (MaaS). Por lo tanto, su licencia permite que Abliteration.ai modifique GLM-5.3, aloje el modelo resultante y venda acceso al mismo.

Pesos abiertos, servicio propietario

El concepto de abliteración no es nuevo. Los desarrolladores han publicado modelos modificados en Hugging Face durante años. Sin embargo, Abliteration.ai no pone a disposición del público los pesos modificados para descarga. En su lugar, ellos gestionan el alojamiento y las operaciones. El GLM-5.3 abliterado tiene un costo de cinco dólares por cada millón de tokens de entrada o salida bajo la tarifa estándar.

El servicio brinda a los clientes acceso al modelo sin necesidad de descargarlo o ejecutar la infraestructura de GPU por cuenta propia. Esta configuración lista para usar ("turnkey") también reduce la barrera para usos problemáticos.

La empresa asegura que existe demanda

Abliteration.ai comercializa el modelo para ciberseguridad ofensiva, red teaming de IA, pruebas de agentes y trabajo de confianza y seguridad. Esto incluye la reproducción de vulnerabilidades conocidas, exploits de prueba de concepto, análisis de malware y ataques de phishing simulados.

Un fundador anónimo de la startup afirmó en el podcast ThursdAI que la demanda temprana provino especialmente de empresas que prueban agentes de IA desplegados por grandes organizaciones y bancos. Estos sistemas deben ser verificados para determinar si los atacantes pueden utilizar jailbreaks o inyección de prompts para activar acciones no autorizadas.

¿Cuánta abliteración es realmente necesaria para este tipo de trabajo? Sigue siendo una pregunta abierta. Según SaferAI, el modelo GLM-5.2 sin modificar ya rechazaba cero tareas en sus evaluaciones de seguridad ofensiva. Algunos profesionales también se muestran escépticos. Varios proveedores de red-teaming entrevistados por TechCrunch señalaron que los modelos abliterados no son parte de su trabajo rutinario. La empresa de seguridad Fabraix, por ejemplo, confía más en el fine-tuning de modelos abiertos.

La retención cero: ¿ventaja o riesgo?

TechCrunch informó que logró que el modelo generara código para extraer contraseñas guardadas de Chrome y una guía detallada para cultivar un patógeno peligroso sin mucha dificultad. Aun así, los mecanismos de seguridad seguían activándose ante solicitudes de autolesión. Según sus preguntas frecuentes, Abliteration.ai también bloquea contenido sexual que involucre a menores. Los clientes pueden añadir reglas adicionales de forma opcional.

Los prompts y las respuestas no se almacenan, según el proveedor. Se conservan metadatos operativos como el recuento de tokens, marcas de tiempo, IDs de modelo y datos de facturación. Para los equipos de seguridad legítimos, esto puede mantener el código fuente confidencial o vulnerabilidades no reveladas fuera de los datos almacenados del proveedor. Sin embargo, si se abusa del servicio, Abliteration.ai afirma que no tiene registros de prompts o respuestas para inspeccionar posteriormente. La empresa tampoco requiere una verificación de identidad convencional. Esto puede dificultar la investigación de usos problemáticos, a pesar de que los metadatos de cuenta, pago y uso siguen siendo registrados.

El representante anónimo de la empresa argumenta que las verificaciones de identidad no distinguirían de manera confiable a los usuarios legítimos de los malintencionados. También sostiene que controles de acceso más estrictos podrían poner a las empresas de seguridad más pequeñas en desventaja frente a las grandes corporaciones.

El cliente establece las reglas

A través de una puerta de enlace de políticas opcional, los clientes empresariales pueden definir qué solicitudes están permitidas, bloqueadas, modificadas o registradas. La empresa también vende datos sintéticos de entrenamiento y evaluación. No obstante, el acceso estándar al modelo permanece en gran medida sin restricciones. Las reglas de control adicionales deben activarse explícitamente.

La misma filosofía se extiende a los clientes gubernamentales. Abliteration.ai afirma estar registrada para adquisiciones del gobierno de EE. UU. en SAM.gov y promueve modelos versionados, registros de auditoría y reglas específicas para cada agencia, comenzando con proyectos piloto que no involucran Información Clasificada No Clasificada Controlada (CUI).

La modificación de GLM-5.3 está permitida bajo su licencia. Si un uso específico es legal depende de lo que se realice y de la jurisdicción aplicable. Para las pruebas de seguridad, Abliteration.ai requiere explícitamente autorización por escrito para los sistemas objetivo y el cumplimiento de las leyes aplicables. Esto deja una pregunta pendiente sobre qué responsabilidades debe asumir un proveedor cuando ofrece capacidades ofensivas potentes a través de un servicio fácilmente accesible.

Abliteration.ai no es el primero en hacer esto. Proveedores como Audn.AI con PenClaw y Silk Compute también alojan modelos abliterados o mayormente sin restricciones para casos de uso de seguridad. La oferta particular de Abliteration.ai combina GLM-5.3 con un acceso a API sencillo y una capa de políticas opcional para clientes empresariales.

La modificación afecta al modelo completo

Un estudio preliminar sugiere que los rechazos pueden reducirse drásticamente en ciertos modelos sin una disminución comparable en el rendimiento de generación de código. Otros experimentos, sin embargo, encuentran cambios de comportamiento incluso en tareas donde el modelo base no rechazaba nada en absoluto. En otras palabras, la abliteración no elimina quirúrgicamente un solo rasgo, sino que profundiza en cómo se comporta el modelo.

Abliteration.ai también traslada gran parte de la toma de decisiones sobre los límites del modelo del proveedor al cliente, y aún no está resuelto si ese arreglo puede servir para un trabajo de seguridad legítimo sin facilitar sustancialmente los usos dañinos.

Vía The Decoder.