El 11 de agosto, Anthropic anunció que todos sus futuros modelos Claude generarán texto que contiene una marca de agua, identificando sus resultados como producidos por IA. La empresa no está sola en este camino; Google ya emplea su propia marca de agua de texto (en la cual se basa la de Anthropic) en los resultados de sus modelos Gemini. Por su parte, OpenAI aún no ha implementado una marca de agua de texto, pero tiene planes concretos para hacerlo en el futuro cercano.

La rápida expansión del uso de marcas de agua es, en parte, una respuesta a la Ley de IA de la Unión Europea, que exige marcas de agua para modelos de IA lanzados después del 2 de agosto de 2026, junto con otras regulaciones propuestas destinadas a frenar la propagación de contenido engañoso o manipulador. Sin embargo, estas nuevas reglas podrían tener un costo para los usuarios de IA que simplemente buscan obtener los mejores resultados posibles.

Las marcas de agua para IA pueden aplicarse a muchas formas de contenido: la Ley de IA de la UE también las requiere para imágenes, audio y video. Dichas marcas de agua en medios han estado en uso durante años y, aunque su eficacia como solución integral para identificar contenido artificial sigue siendo objeto de debate, pueden alcanzar tasas de detección superiores al 99 por ciento. Las marcas de agua para imagen y video ya son implementadas por OpenAI, Google y Meta, entre otros. (Anthropic no proporciona un modelo de generación de imágenes).

Las marcas de agua de texto, sin embargo, se han desplegado con menor frecuencia, y no todos están convencidos de que el marcado de texto pueda funcionar sin comprometer la calidad de la respuesta de un modelo de IA. John Gruber, un prolífico escritor tecnológico y cocreador del lenguaje Markdown, califica la marca de agua como una "perversión de la escritura" y disputa la afirmación de Anthropic de que una marca de agua no cambia el significado o la calidad del texto. Las imágenes consisten en millones de píxeles, señala, mientras que las respuestas de texto a menudo abarcan solo decenas o cientos de palabras. El texto parece ofrecer mucho menos espacio para alterar la salida de la IA de una manera que sea detectable pero no disruptiva.

John Kirchenbauer, investigador posdoctoral en el Vector Institute y coautor de un paper de 2023 que fue uno de los primeros en describir un método de marca de agua de texto, discrepa. "[Una marca de agua] no sería detectable si no hubiera un cambio. Este es un punto muy fundamental", afirma. "La pregunta es, ¿te importa si no es la distribución original exacta si, para todos los efectos, no cambia la utilidad para ti?"

De manera realista, el problema se reduce a esa palabra: "utilidad". ¿Degrada significativamente el marcado de texto generado por IA la experiencia de la persona que lo utiliza? La respuesta aún está en disputa.

¿Cómo funcionan las marcas de agua en el texto de la IA?

El término "marca de agua" es tan familiar que puede causar confusión sobre cómo funciona la tecnología cuando se aplica a la IA. Una marca de agua de texto no es metadatos ni caracteres invisibles; es algo mucho más sutil. Los detalles exactos varían según los métodos, pero las marcas de agua de texto son generalmente imposibles de detectar para un humano (y, en muchos casos, incluso para una computadora) sin acceso a la clave específica utilizada para detectar una marca determinada. Entender por qué requiere comprender cómo funcionan los LLM.

Un LLM produce una probabilidad para cada palabra que podría seguir en cada paso de su respuesta a un prompt. (A partir de aquí, usaré "palabras" indistintamente con "tokens", aunque los tokens también representan números, puntuación y más). Una palabra probable podría obtener un 40 por ciento de probabilidad, una alternativa plausible un 10 por ciento y una improbable una fracción de un por ciento. El modelo luego elige una palabra al azar, ponderada por esos números. La palabra más probable suele ganar, pero no siempre.

Este proceso proporciona una oportunidad para ocultar una marca de agua de texto introduciendo cambios sutiles en la forma en que se seleccionan las palabras. El paper de 2023 de Kirchenbauer y sus colegas proporcionó uno de los primeros ejemplos de cómo implementar una marca de agua de texto, y sigue siendo la técnica más citada. Los investigadores describen una marca de agua que clasifica las palabras en una lista roja y una lista verde. Las palabras de la lista roja no se modifican, pero las palabras de la lista verde son impulsadas para ser ligeramente más probables.

"Si muestreamos desde esta distribución modificada, entonces, aunque cualquier elección de token no necesariamente provendrá de ese conjunto preferido, a lo largo de muchas muestras, elegiremos preferencialmente palabras de ese subconjunto con peso aumentado", dice Kirchenbauer. La marca de agua de texto está incrustada en la elección de las palabras utilizadas, razón por la cual es efectivamente invisible para los humanos. Kirchenbauer y sus colegas reportaron una tasa de detección del 98,4 por ciento, y cero falsos positivos, en respuestas que contienen alrededor de 200 tokens. El patrón incrustado de probabilidades de palabras también significa que un simple parafraseo no ocultará la marca de agua. El paper informa que eliminar la marca de agua de una respuesta larga requiere cambiar aproximadamente un cuarto de sus palabras o más.

¿Degrada la marca de agua la calidad del texto de IA?

Aunque la marca de agua de texto de IA está diseñada para ser invisible para los lectores humanos, por definición influye en los patrones de palabras en el texto generado por IA. Al alterar las probabilidades de los tokens, el modelo se desvía ligeramente de su comportamiento estadístico natural. Esto lleva a la preocupación de que la "creatividad" o la precisión lógica puedan verse afectadas.

Los críticos argumentan que para tareas de escritura creativa o razonamiento complejo, donde la elección exacta de cada palabra es crucial para mantener el tono o la coherencia, cualquier intervención algorítmica podría introducir errores sutiles. Si bien los desarrolladores aseguran que el impacto es insignificante, la comunidad de investigadores sigue analizando si bajo condiciones de estrés extremo (como prompts muy cortos o solicitudes altamente técnicas), la marca de agua podría degradar la calidad del output final.

Vía IEEE Spectrum.