O que é preciso saber sobre marcas d’água digitais e verificação de identidade
À medida que a IA generativa se torna mais sofisticada, um dos maiores desafios enfrentados pelas empresas de tecnologia é determinar se um conteúdo foi criado por um ser humano ou gerado por IA. A marca d’água digital está se destacando como uma possível solução.
Notícias recentes sobre a inserção de marcas d’água pela Claude em textos gerados por IA trouxeram uma atenção renovada à tecnologia e ao seu papel potencial na identificação de conteúdo sintético. A Anthropic não está agindo sozinha nessa questão: a marca d’água do Claude é uma versão do método SynthID-Text do Google DeepMind, adotado para cumprir as obrigações de transparência previstas na Lei de IA da UE, à qual a maioria dos principais fornecedores de modelos também aderiu. A ideia básica é incorporar sinais no conteúdo gerado por IA que sejam efetivamente invisíveis aos seres humanos, mas que possam ser detectados posteriormente por um sistema projetado para reconhecê-los.
No que diz respeito à verificação de identidade — em que a IA generativa já pode ser utilizada para criar ou manipular documentos de identidade, retratos e outras evidências —, essa capacidade poderia se tornar mais um indicador útil para identificar conteúdo sintético.
Mas há uma limitação importante. Os fraudadores não se comportam como usuários comuns. Qualquer sistema de segurança baseado em marcas d’água digitais precisa, portanto, levar em conta não apenas se a marca d’água é capaz de identificar conteúdo gerado por IA em condições normais, mas também se esse sinal permanece intacto quando um invasor tenta deliberadamente destruí-lo.
O que é uma marca d’água digital?
Uma marca d'água digital é uma informação incorporada a um conteúdo digital que pode ser detectada posteriormente para ajudar a identificar sua origem ou autenticidade.
Ao contrário de uma marca d’água visível sobreposta a uma imagem, as marcas d’água digitais podem ser criadas de forma que as pessoas que acessam o conteúdo não percebam nada de anormal. Em vez disso, o conteúdo contém padrões ocultos que um sistema de detecção é capaz de reconhecer.
No caso de textos gerados por IA, por exemplo, a inserção de marcas d’água pode influenciar os padrões estatísticos criados à medida que um modelo seleciona palavras durante a geração. O texto resultante ainda parece normal para um leitor humano, mas passagens suficientemente longas apresentam padrões estatísticos que permitem que um sistema compatível reconheça que o conteúdo foi gerado por IA.
O conceito tem implicações potencialmente significativas para a proveniência da IA. Se um sistema for capaz de reconhecer com confiabilidade o conteúdo produzido por um modelo de IA, as organizações terão mais uma maneira de distinguir o conteúdo sintético do material criado por humanos.
No entanto, identificar conteúdo gerado por IA em condições controladas e detectá-lo durante um ataque adversário são dois desafios muito diferentes. Os desenvolvedores são sinceros a respeito disso. A própria documentação do Google afirma que o SynthID Text não foi projetado para impedir adversários motivados (cf. Limitações em https://ai.google.dev/responsible/docs/safeguards/synthid).
O invasor não precisa preservar a marca d’água
As marcas d'água só funcionam se estiverem intactas para que possam ser detectadas. Mas um fraudador que sabe da existência dessas marcas não tem motivo para enviar o documento original sem alterações.
Em vez disso, o invasor poderia passar esse texto por outro serviço, traduzi-lo para um idioma estruturalmente diferente do original e, em seguida, traduzi-lo de volta. A passagem resultante poderia transmitir essencialmente a mesma informação, mas as propriedades estatísticas usadas para identificar o texto original gerado por IA poderiam ser alteradas. Isso não é hipotético, e não se trata de uma crítica contestada pelos fornecedores. A própria documentação do SynthID, do Google, lista isso como uma limitação: a detecção “pode ser significativamente reduzida quando um texto gerado por IA é completamente reescrito ou traduzido para outro idioma”.
Pesquisadores mediram a magnitude desse fenômeno. Em um estudo, a tradução de um texto com marca d’água para o chinês e de volta para o inglês permitiu que cerca de um terço das passagens geradas por IA escapassem completamente do detector. Em uma análise separada da ETH Zurich, os pesquisadores conseguiram remover a marca d’água em mais de nove em cada dez tentativas. As próprias orientações da Anthropic apontam na mesma direção, observando que uma edição leve provavelmente não removerá a marca d’água do Claude, mas uma reescrita completa sim
O invasor não necessariamente derrotou o próprio detector de marca d’água. Em vez disso, ele alterou as evidências que o detector esperava examinar. Os sistemas de segurança não funcionam contra usuários que respeitosamente preservam os sinais criados para detectá-los. Eles funcionam contra adversários cujo objetivo é compreender esses sinais, manipulá-los e encontrar maneiras de contorná-los. É por isso que a segurança baseada em IA exige pensar como um invasor.
O que as marcas d’água digitais significam para a verificação de identidade?
Então, o que tudo isso significa para a verificação de identidade?
À medida que a qualidade das imagens geradas por IA melhora, as marcas d’água poderiam fornecer informações valiosas sobre se uma imagem se originou de um determinado sistema de IA generativa. Na verificação de identidade, isso poderia, potencialmente, servir como mais um indício na avaliação da autenticidade de um documento de identidade ou retrato apresentado.
Suponha que alguém crie um documento de identidade sintético usando um gerador de imagens de IA que incorpore uma marca d’água digital detectável. Se o invasor enviar esse arquivo digital original diretamente para um fluxo de trabalho de verificação de identidade, a detecção da marca d’água pode ser útil.
No entanto, conforme observado acima, um invasor experiente provavelmente não preservará o arquivo original. Ele poderia exibir o documento sintético em outra tela e fotografá-lo. Poderia imprimir o documento e fotografá-lo novamente com uma câmera. Ele poderia, potencialmente, recortar, redimensionar, compactar, editar ou transformar a imagem de alguma outra forma antes de enviá-la.
Cada transformação cria uma oportunidade de enfraquecer ou destruir as informações incorporadas ao ativo digital original. O documento pode parecer substancialmente o mesmo para um observador humano, enquanto o sinal subjacente usado para estabelecer sua proveniência pode não existir mais.
A proveniência digital é apenas um indício
Nada disso significa que a marca d’água digital não tenha valor. Saber que uma imagem ou um trecho de texto foi gerado por IA pode ser uma informação extremamente útil. À medida que os padrões e as tecnologias para estabelecer a proveniência digital melhoram, essas informações podem se tornar cada vez mais valiosas para plataformas que buscam entender de onde o conteúdo digital se originou.
Mas, na prevenção de fraudes, uma boa regra geral é que nenhum sinal isolado deve ser considerado definitivo. Uma marca d’água pode, potencialmente, revelar algo importante quando está presente. Sua ausência não prova nada. Se um documento de identidade contiver uma marca d’água reconhecível gerada por IA, essa informação pode contribuir para uma decisão sobre fraude. Mas, se a marca d’água não for detectada, o sistema ainda precisa determinar se o documento em si é autêntico.
Isso exige ir além da proveniência e examinar as evidências contidas na própria interação de identidade.
Detectar o ataque, e não apenas a ferramenta que o criou
A IA generativa reduziu drasticamente as dificuldades para criar documentos de identidade sintéticos convincentes e outros conteúdos fraudulentos. Mas os invasores não se limitam a um único modelo, uma única técnica ou uma única geração de tecnologia.
Eles podem alternar entre modelos. Podem utilizar serviços de diferentes provedores ou executar localmente modelos de peso aberto que não apresentam nenhuma marca d’água. Podem manipular o conteúdo gerado após sua criação. E podem transferir conteúdo sintético entre os mundos digital e físico, especificamente para eliminar sinais destinados a identificá-lo.
É por isso que a verificação de identidade requer várias camadas de evidências. A autenticidade dos documentos, sinais de manipulação digital, detecção de IA generativa, análise de retratos, qualidade da imagem, sinais do dispositivo e comportamentais, bem como o contexto em que a interação ocorre, podem contribuir para determinar se uma identidade é confiável.
O objetivo não é identificar qual modelo de IA um invasor por acaso utilizou. Trata-se de determinar se as evidências de identidade apresentadas são legítimas. A marca d’água digital pode fortalecer esse processo, mas não deve se tornar um atalho para contorná-lo.
Para vencer a corrida pela segurança em IA, é preciso pensar como um invasor
O rápido desenvolvimento das marcas d’água digitais é um passo encorajador rumo a uma maior transparência em relação ao conteúdo gerado por IA. À medida que a IA generativa se torna parte integrante do mundo digital, as tecnologias que ajudam a identificar a origem do conteúdo se tornarão cada vez mais importantes.
Os invasores não se limitam a adotar novas tecnologias. Eles estudam as defesas criadas em torno delas e buscam maneiras de remover, manipular ou contornar os sinais dos quais essas defesas dependem.
Para a verificação de identidade, isso significa estar preparado para analisar o documento após o desaparecimento da marca d’água, a imagem gerada por IA após ter sido impressa e digitalizada novamente, e o conteúdo sintético após ter passado por várias transformações. As marcas d’água digitais podem ajudar a identificar a origem do conteúdo. A segurança de identidade ainda precisa determinar se podemos confiar no que resta.