OpenAI implémente un filigrane statistique pour les textes générés par IA dans l'UE
OpenAI va commencer à appliquer un filigrane statistique aux textes générés par ses modèles dans l'Union européenne. Ce système vise à identifier le contenu produit par l'IA, tout en reconnaissant ses limites de détection.
La société d'intelligence artificielle OpenAI a annoncé qu'elle commencerait à appliquer un filigrane statistique invisible aux textes générés par ses modèles au sein de l'Union européenne. Cette approche, nommée textGrain, vise à aider à identifier le contenu produit par des systèmes tels que ChatGPT et Codex, avec un déploiement prévu dans les semaines à venir.
Le filigrane modifie les modèles statistiques de sélection des mots sans ajouter de marques visibles ou de caractères cachés. Un détecteur distinct vérifie la présence de ces modèles. Initialement, l'accès au détecteur sera limité aux chercheurs et aux organisations expertes approuvés. OpenAI a déclaré que le détecteur indiquera uniquement si un filigrane OpenAI est détecté et n'identifiera pas les utilisateurs ni leurs invites.
OpenAI a reconnu des limites significatives à sa technologie de filigrane. Des tests indiquent que le détecteur est plus fiable pour les longs passages de texte, tandis que ses performances diminuent pour les textes courts, fortement contraints ou lourdement édités. Remplacer seulement 10 % des mots dans un passage de 400 tokens par des synonymes a réduit les taux de détection d'environ 92 % à 66 %.
L'entreprise a souligné qu'un filigrane ne peut pas établir la propriété, l'exactitude ou l'auteur d'un texte. De plus, l'absence d'un filigrane détecté ne prouve pas non plus l'origine humaine du texte. Ces limitations sont citées comme raisons pour ne pas rendre le détecteur publiquement disponible au lancement.
Cette démarche s'aligne sur les réglementations de l'UE, qui exigent des fournisseurs d'IA générative qu'ils rendent les textes générés identifiables d'une manière lisible par machine. OpenAI considère actuellement le filigrane comme un signal indiquant qu'un système OpenAI a pu générer ou traiter le texte, plutôt qu'une preuve définitive d'auteur par l'IA.