Lo que hay que saber sobre las marcas de agua digitales y la verificación de identidad 

Last updated

A medida que la IA generativa se vuelve más sofisticada, uno de los mayores retos a los que se enfrentan las empresas tecnológicas es determinar si un contenido ha sido creado por un ser humano o generado por la IA. Las marcas de agua digitales se perfilan como una posible solución.

Las recientes noticias sobre la incorporación de marcas de agua por parte de Claude en sus textos generados por IA han vuelto a centrar la atención en esta tecnología y en su posible papel a la hora de identificar contenidos sintéticos. Anthropic no actúa en solitario en este ámbito: la marca de agua de Claude es una versión del método SynthID-Text de Google DeepMind, adoptado para cumplir con las obligaciones de transparencia establecidas en la Ley de IA de la UE, a la que también se han adherido la mayoría de los principales proveedores de modelos. La idea básica consiste en incrustar en el contenido generado por IA señales que son prácticamente invisibles para los seres humanos, pero que posteriormente pueden ser detectadas por un sistema diseñado para reconocerlas.

En lo que respecta a la verificación de la identidad —donde actualmente se puede utilizar la IA generativa para crear o manipular documentos de identidad, retratos y otras pruebas—, esa capacidad podría convertirse en otra señal útil para identificar contenidos sintéticos.

Pero hay una limitación importante. Los estafadores no se comportan como los usuarios habituales. Por lo tanto, cualquier sistema de seguridad basado en marcas de agua digitales debe tener en cuenta no solo si la marca de agua puede identificar el contenido generado por IA en condiciones normales, sino también si esa señal perdura cuando un atacante intenta destruirla deliberadamente.

¿Qué es una marca de agua digital?

Una marca de agua digital es información incrustada en un contenido digital que puede detectarse posteriormente para ayudar a identificar su origen o autenticidad.

A diferencia de una marca de agua visible superpuesta a una imagen, las marcas de agua digitales pueden diseñarse de tal forma que quienes consumen el contenido no noten nada inusual. En cambio, el contenido contiene patrones subyacentes que un sistema de detección puede reconocer.

En el caso del texto generado por IA, por ejemplo, la incorporación de marcas de agua puede influir en los patrones estadísticos que se crean cuando un modelo selecciona palabras durante la generación. El texto resultante sigue pareciendo normal para un lector humano, pero los pasajes lo suficientemente largos presentan patrones estadísticos que permiten a un sistema compatible reconocer que el contenido ha sido generado por IA.

Este concepto tiene implicaciones potencialmente importantes para la procedencia de la IA. Si un sistema es capaz de reconocer de forma fiable el contenido generado por un modelo de IA, las organizaciones disponen de otra forma de distinguir el contenido sintético del material creado por humanos.

Sin embargo, identificar contenido generado por IA en condiciones controladas y detectarlo durante un ataque adversario son dos retos muy distintos. Los desarrolladores son sinceros al respecto. La propia documentación de Google afirma que SynthID Text no está diseñado para detener a adversarios decididos (véase «Limitaciones» en https://ai.google.dev/responsible/docs/safeguards/synthid).

El atacante no tiene por qué conservar la marca de agua

Las marcas de agua solo funcionan si están intactas para que puedan detectarse. Pero un estafador que sabe que existen las marcas de agua no tiene ningún motivo para presentar el documento original sin modificarlo.

En cambio, el atacante podría pasar ese texto por otro servicio, traducirlo a un idioma estructuralmente diferente del original y, a continuación, volver a traducirlo. El fragmento resultante podría transmitir esencialmente la misma información, pero las propiedades estadísticas utilizadas para identificar el texto original generado por IA podrían verse alteradas.  Esto no es una hipótesis, y no es una crítica que los proveedores rebaten. La propia documentación de SynthID de Google lo menciona como una limitación: la detección «puede verse muy reducida cuando un texto generado por IA se reescribe a fondo o se traduce a otro idioma».

Los investigadores han cuantificado este porcentaje. En un estudio, al traducir un texto con marca de agua al chino y volver a traducirlo al inglés, aproximadamente un tercio de los pasajes generados por IA lograron eludir por completo el detector. En un análisis independiente de la ETH de Zúrich, los investigadores lograron eliminar la marca de agua en más de nueve de cada diez intentos. Las propias recomendaciones de Anthropic apuntan en la misma dirección, señalando que una edición superficial probablemente no eliminará la marca de agua de Claude, pero que una reescritura completa sí lo hará.

El atacante no ha derrotado necesariamente al detector de marcas de agua en sí. Más bien, ha alterado las pruebas que el detector esperaba examinar. Los sistemas de seguridad no se enfrentan a usuarios que respetan educadamente las señales diseñadas para detectarlos. Se enfrentan a adversarios cuyo objetivo es comprender esas señales, manipularlas y encontrar formas de eludirlas. Por eso, la seguridad basada en la IA requiere pensar como un atacante.

¿Qué implican las marcas de agua digitales para la verificación de la identidad?

Entonces, ¿qué significa todo esto para la verificación de identidad? 

A medida que mejoran las imágenes generadas por IA, las marcas de agua podrían proporcionar información valiosa sobre si una imagen procede de un sistema concreto de IA generativa. En la verificación de identidad, esto podría suponer una señal adicional a la hora de evaluar si un documento de identidad o una fotografía presentados son auténticos.

Supongamos que alguien crea un documento de identidad sintético utilizando un generador de imágenes basado en IA que incorpora una marca de agua digital detectable. Si el atacante sube ese archivo digital original directamente a un proceso de verificación de identidad, la detección de la marca de agua podría resultar útil.

Sin embargo, como se ha señalado anteriormente, es probable que un atacante experto no conserve el archivo original. Podría mostrar el documento sintético en otra pantalla y fotografiarlo. Podría imprimir el documento y volver a capturarlo con una cámara. Podría recortar, cambiar el tamaño, comprimir, editar o transformar de cualquier otra forma la imagen antes de enviarla.

Cada transformación supone una oportunidad para debilitar o destruir la información incorporada en el activo digital original. El documento puede parecer prácticamente idéntico a un observador humano, mientras que la señal subyacente utilizada para establecer su procedencia puede haber desaparecido.

La procedencia digital no es más que una señal

Nada de esto significa que las marcas de agua digitales no sean útiles. Saber que una imagen o un fragmento de texto ha sido generado por IA podría ser una indicación extremadamente útil. A medida que mejoren los estándares y las tecnologías para establecer la procedencia digital, estas indicaciones podrían cobrar cada vez más valor para las plataformas que intentan comprender el origen del contenido digital.

Sin embargo, en la prevención del fraude, una buena regla general es que ninguna señal por sí sola debe considerarse definitiva. Una marca de agua puede aportar información importante cuando está presente. Su ausencia no demuestra nada. Si un documento de identidad contiene una marca de agua reconocible generada por IA, esa información podría contribuir a la toma de una decisión sobre fraude. Pero si no se detecta la marca de agua, el sistema aún debe determinar si el documento en sí es auténtico.

Para ello es necesario ir más allá de la procedencia y examinar las pruebas que se desprenden de la propia interacción identitaria.

Detectar el ataque, no solo la herramienta que lo ha generado

La IA generativa ha reducido drásticamente las dificultades para crear documentos de identidad sintéticos convincentes y otros contenidos fraudulentos. Sin embargo, los atacantes no se limitan a un solo modelo, una sola técnica o una sola generación de tecnología.

Pueden cambiar de modelo. Pueden utilizar servicios de distintos proveedores o ejecutar localmente modelos de peso abierto que no lleven ninguna marca de agua. Pueden manipular el contenido generado una vez creado. Y pueden trasladar el contenido sintético entre el mundo digital y el físico con el objetivo específico de eliminar las señales diseñadas para identificarlo.

Por eso, la verificación de la identidad requiere múltiples niveles de pruebas. La autenticidad de los documentos, los indicios de manipulación digital, la detección mediante IA generativa, el análisis de retratos, la calidad de la imagen, las señales relacionadas con el dispositivo y el comportamiento, así como el contexto en el que se produce una interacción, pueden contribuir a determinar si una identidad es fiable.

El objetivo no es identificar qué modelo de IA ha utilizado un atacante. Se trata de determinar si las pruebas de identidad que se presentan son legítimas. Las marcas de agua digitales pueden reforzar ese proceso, pero no deben convertirse en un atajo para eludirlo.

Para ganar la carrera por la seguridad de la IA hay que pensar como un atacante

El rápido desarrollo de las marcas de agua digitales supone un paso alentador hacia una mayor transparencia en torno al contenido generado por la IA. A medida que la IA generativa se vaya integrando en todo el mundo digital, las tecnologías que ayudan a determinar el origen del contenido cobrarán cada vez más importancia.

Los atacantes no se limitan a adoptar nuevas tecnologías. Estudian las defensas creadas en torno a ellas y buscan formas de eliminar, manipular o eludir las señales de las que dependen dichas defensas.

En lo que respecta a la verificación de la identidad, esto implica prepararse para analizar el documento una vez que la marca de agua haya desaparecido, la imagen generada por IA tras su impresión y nueva captura, y el contenido sintético tras haber pasado por varias transformaciones. Las marcas de agua digitales pueden ayudarnos a determinar el origen del contenido. La seguridad de la identidad aún debe determinar si podemos confiar en lo que queda.

Descubre nuestras soluciones

Explorar nuestras soluciones está a un clic de distancia. Prueba nuestros productos o habla con nosotros con uno de nuestros expertos para profundizar en lo que ofrecemos.

Informe
Análisis del aumento del fraude de identidad impulsado por la inteligencia artificial

La IA no solo ha acelerado el fraude, sino que lo ha convertido en un sistema. Hemos analizado millones de interacciones relacionadas con la identidad para trazar un mapa de cómo están evolucionando los ataques a la identidad en las distintas regiones, según los tipos de ataque y los niveles de sofisticación, y qué deben replantearse las organizaciones para mantenerse al día.

Ver los datos