Ce qu'il faut savoir sur les filigranes numériques et la vérification d'identité
À mesure que l'IA générative gagne en sophistication, l'un des principaux défis auxquels sont confrontées les entreprises technologiques consiste à déterminer si un contenu a été créé par un être humain ou généré par l'IA. Le tatouage numérique apparaît comme une solution potentielle.
Les récentes informations concernant l'apposition par Claude d'un filigrane sur ses textes générés par IA ont attiré une attention renouvelée sur cette technologie et son rôle potentiel dans l'identification des contenus synthétiques. Anthropic n’est pas la seule à agir dans ce sens : le filigrane de Claude est une version de la méthode SynthID-Text de Google DeepMind, adoptée pour répondre aux obligations de transparence prévues par la loi européenne sur l’IA, à laquelle la plupart des principaux fournisseurs de modèles ont également adhéré. L'idée de base consiste à intégrer dans le contenu généré par l'IA des signaux qui sont pratiquement invisibles pour l'œil humain, mais qui peuvent être détectés ultérieurement par un système conçu pour les reconnaître.
En matière de vérification d'identité, alors que l'IA générative peut désormais être utilisée pour créer ou manipuler des documents d'identité, des portraits et d'autres éléments de preuve, cette capacité pourrait constituer un autre indicateur utile pour identifier les contenus synthétiques.
Il existe toutefois une limite importante. Les fraudeurs ne se comportent pas comme des utilisateurs lambda. Tout système de sécurité reposant sur des filigranes numériques doit donc non seulement vérifier si le filigrane permet d’identifier un contenu généré par l’IA dans des conditions normales, mais aussi si ce signal résiste lorsqu’un pirate tente délibérément de le détruire.
Qu'est-ce qu'un filigrane numérique ?
Un filigrane numérique est une information intégrée à un contenu numérique qui peut être détectée ultérieurement afin de contribuer à en identifier l'origine ou l'authenticité.
Contrairement à un filigrane visible superposé à une image, les filigranes numériques peuvent être conçus de manière à ce que les personnes qui consultent le contenu ne remarquent rien d'inhabituel. Le contenu contient en effet des motifs cachés qu'un système de détection est capable de reconnaître.
Dans le cas d'un texte généré par une IA, par exemple, l'ajout d'un filigrane peut influencer les schémas statistiques qui se dessinent lorsque le modèle sélectionne des mots au cours de la génération. Le texte obtenu semble toujours normal aux yeux d'un lecteur humain, mais des passages suffisamment longs présentent des schémas statistiques qui permettent à un système compatible de reconnaître que le contenu a été généré par une IA.
Ce concept pourrait avoir des implications importantes en matière de traçabilité de l'IA. Si un système est capable de reconnaître de manière fiable les contenus générés par un modèle d'IA, les organisations disposeront d'un moyen supplémentaire de distinguer les contenus synthétiques de ceux créés par des humains.
Cependant, identifier un contenu généré par l’IA dans des conditions contrôlées et le détecter lors d’une attaque adversaire sont deux défis très différents. Les développeurs le reconnaissent ouvertement. La documentation de Google précise que SynthID Text n'est pas conçu pour empêcher des attaquants déterminés d'atteindre leur but (cf. la section « Limitations » sur https://ai.google.dev/responsible/docs/safeguards/synthid).
L'attaquant n'est pas obligé de conserver le filigrane
Les filigranes ne fonctionnent que s'ils sont intacts pour pouvoir être détectés. Mais un fraudeur qui sait que des filigranes existent n'a aucune raison de soumettre le document original sans y apporter de modification.
Au lieu de cela, l’attaquant pourrait faire passer ce texte par un autre service, le traduire dans une langue dont la structure diffère de celle de l’original, puis le retraduire. Le passage ainsi obtenu pourrait transmettre essentiellement les mêmes informations, mais les propriétés statistiques utilisées pour identifier le texte original généré par l’IA pourraient être altérées. Il ne s’agit pas d’une hypothèse, et ce n’est pas une critique que les fournisseurs contestent. La documentation de SynthID de Google elle-même mentionne cela comme une limite : la détection « peut être considérablement réduite lorsqu’un texte généré par l’IA est entièrement réécrit ou traduit dans une autre langue ».
Des chercheurs ont quantifié ce phénomène. Dans une étude, la traduction d’un texte comportant un filigrane vers le chinois, puis sa retraduction vers l’anglais, a permis à environ un tiers des passages générés par l’IA d’échapper complètement au détecteur. Dans une autre analyse menée par l’ETH Zurich, les chercheurs ont réussi à effacer le filigrane dans plus de neuf tentatives sur dix. Les recommandations d’Anthropic vont dans le même sens, précisant qu’une modification légère ne suffira probablement pas à supprimer le filigrane de Claude, mais qu’une réécriture complète y parviendra.
L'attaquant n'a pas nécessairement contourné le détecteur de filigrane en lui-même. Il a plutôt altéré les éléments de preuve que le détecteur s'attendait à examiner. Les systèmes de sécurité ne sont pas conçus pour faire face à des utilisateurs qui préservent consciencieusement les signaux destinés à les démasquer. Ils sont conçus pour faire face à des adversaires dont l'objectif est de comprendre ces signaux, de les manipuler et de trouver des moyens de les contourner. C’est pourquoi la sécurité basée sur l’IA nécessite de penser comme un attaquant.
Quel est l'intérêt des filigranes numériques pour la vérification d'identité ?
Alors, qu'est-ce que tout cela signifie pour la vérification d'identité ?
À mesure que la qualité des images générées par l’IA s’améliore, l’apposition de filigranes pourrait fournir des informations précieuses permettant de déterminer si une image provient d’un système d’IA générative particulier. Dans le cadre de la vérification d’identité, cela pourrait constituer un indice supplémentaire pour évaluer l’authenticité d’une pièce d’identité ou d’un portrait présenté.
Imaginons qu’une personne crée un document d’identité synthétique à l’aide d’un générateur d’images basé sur l’IA qui y intègre un filigrane numérique détectable. Si l’attaquant télécharge ce fichier numérique original directement dans un processus de vérification d’identité, la détection du filigrane peut s’avérer utile.
Mais, comme indiqué plus haut, un pirate expérimenté ne conservera probablement pas le fichier d'origine. Il pourrait afficher le document synthétique sur un autre écran et le photographier. Il pourrait imprimer le document et le photographier à nouveau à l'aide d'un appareil photo. Il pourrait éventuellement recadrer, redimensionner, compresser, modifier ou transformer l'image d'une autre manière avant de l'envoyer.
Chaque transformation offre la possibilité d'altérer ou de détruire les informations intégrées dans la ressource numérique d'origine. Le document peut paraître pratiquement identique à un observateur humain, alors que le signal sous-jacent utilisé pour établir sa provenance peut avoir disparu.
La provenance numérique n'est qu'un indice parmi d'autres
Cela ne signifie pas pour autant que le tatouage numérique n'ait aucune utilité. Savoir qu'une image ou un texte a été généré par une IA peut constituer une information extrêmement utile. À mesure que les normes et les technologies permettant d'établir la provenance numérique s'améliorent, ces informations pourraient devenir de plus en plus précieuses pour les plateformes qui cherchent à déterminer l'origine d'un contenu numérique.
Mais en matière de prévention de la fraude, une bonne règle générale consiste à ne jamais considérer un seul indice comme déterminant. Un filigrane peut potentiellement vous fournir une information importante lorsqu’il est présent. Son absence ne prouve rien. Si un document d’identité contient un filigrane généré par IA reconnaissable, cette information pourrait contribuer à une décision relative à la fraude. Mais si le filigrane n’est pas détecté, le système doit tout de même déterminer si le document lui-même est authentique.
Cela implique de ne pas se limiter à la provenance et d’examiner les éléments contenus dans l’interaction identitaire elle-même.
Détecter l'attaque, et pas seulement l'outil qui l'a générée
L'IA générative a considérablement réduit les obstacles à la création de documents d'identité synthétiques convaincants et d'autres contenus frauduleux. Mais les cybercriminels ne se limitent pas à un seul modèle, à une seule technique ou à une seule génération de technologie.
Ils peuvent changer de modèle. Ils peuvent recourir aux services de différents fournisseurs ou exécuter localement des modèles « open-weight » ne comportant aucun filigrane. Ils peuvent modifier le contenu généré après sa création. Et ils peuvent faire passer le contenu synthétique du monde numérique au monde physique, notamment pour éliminer les signaux destinés à l'identifier.
C'est pourquoi la vérification d'identité nécessite plusieurs niveaux de preuve. L'authenticité des documents, les signes de manipulation numérique, la détection des IA génératives, l'analyse des portraits, la qualité de l'image, les signaux liés à l'appareil et au comportement, ainsi que le contexte d'une interaction peuvent tous contribuer à déterminer si une identité est fiable.
L'objectif n'est pas d'identifier le modèle d'IA qu'un pirate a utilisé par hasard, mais de déterminer si les preuves d'identité présentées sont légitimes. Le tatouage numérique peut renforcer ce processus, mais il ne doit pas servir de raccourci pour le contourner.
Pour remporter la course à la sécurité de l'IA, il faut penser comme un pirate informatique
Le développement rapide du tatouage numérique constitue une avancée encourageante vers une plus grande transparence concernant les contenus générés par l'IA. À mesure que l'IA générative s'intègre dans l'univers numérique, les technologies permettant de déterminer l'origine des contenus prendront de plus en plus d'importance.
Les pirates ne se contentent pas d'adopter une nouvelle technologie. Ils étudient les défenses mises en place autour de celle-ci et cherchent des moyens de supprimer, de manipuler ou de contourner les signaux sur lesquels reposent ces défenses.
En matière de vérification d'identité, cela implique de se préparer à examiner le document une fois le filigrane disparu, l'image générée par l'IA après son impression et sa nouvelle capture, ainsi que le contenu synthétique après qu'il a subi plusieurs transformations. Les filigranes numériques peuvent nous aider à déterminer l'origine d'un contenu. La sécurité des identités doit encore déterminer si l'on peut se fier à ce qui reste.