Les filigranes IA peuvent modifier le comportement de sécurité des modèles linguistiques
De nouvelles recherches indiquent que les techniques de filigranage de l'IA peuvent altérer le comportement des modèles linguistiques, affaiblissant potentiellement les garde-fous de sécurité face à des invites nuisibles.

De nouvelles recherches suggèrent que les méthodes de filigranage de l'IA, telles que SynthID-Text de Google, peuvent modifier le comportement des grands modèles linguistiques (LLM) de manière inattendue. Bien qu'elles visent la traçabilité du contenu généré par l'IA, ces techniques pourraient compromettre les fonctions de sécurité des modèles, en particulier face à des invites nuisibles ou adverses.
Anthropic a récemment annoncé que ses futurs modèles Claude utiliseraient l'approche SynthID-Text de Google. Cette méthode modifie subtilemment le processus de génération de texte à l'aide d'une clé secrète, permettant d'identifier le contenu comme généré par l'IA pour ceux qui connaissent la clé. L'implémentation est conforme aux nouvelles réglementations de l'Union européenne exigeant de tels mécanismes d'identification.
La recherche indique que le filigranage peut influencer non seulement la sélection des mots, mais aussi les outils qu'un modèle invoque et son respect des protocoles de sécurité. Dans les scénarios impliquant des invites conçues pour déclencher des actions nuisibles, telles que la divulgation d'informations sensibles, les modèles avec filigranage activé peuvent être plus susceptibles de se conformer à des instructions qui seraient normalement bloquées.
« Comparé aux mêmes modèles sans filigrane, cela va certainement changer leur comportement, surtout lorsque nous les plaçons dans des conditions adverses, ou lorsque nous faisons en sorte que ces modèles appellent des outils lorsqu'ils alimentent un agent », a déclaré Andrea Siposova, chercheuse en sécurité de l'IA chez Lasso Security. « Le filigrane est conçu pour ne pas être perceptible par le lecteur, mais nous savons que lorsque nous modifions quoi que ce soit à ce que le modèle génère, cela entraînera certains compromis, cela apparaîtra quelque part. »
Les résultats soulignent la nécessité de tester de manière approfondie les modèles et agents d'IA lorsque des technologies de filigranage sont actives. Les développeurs doivent s'assurer que les mécanismes de sécurité restent robustes et ne sont pas involontairement affaiblis par les fonctionnalités de traçabilité implémentées.