Anthropic : D'anciens modèles Claude présentent des vulnérabilités à la génération de contenu explicite
Des recherches indiquent que d'anciens modèles Claude d'Anthropic, y compris Opus 4.6 et Haiku 4.5, peuvent être détournés pour générer du contenu adulte explicite, contournant les directives de sécurité.

D'anciennes versions des modèles Claude d'Anthropic, qui restent accessibles, se sont révélées vulnérables à la génération de contenu adulte explicite, contournant les protocoles de sécurité de l'entreprise. Bien qu'Anthropic interdise explicitement la création de matériel sexuellement explicite, les mécanismes de sécurité de modèles tels que Claude Opus 4.6 et Haiku 4.5 ont été déjoués avec succès lors de tests récents.
Des tests menés par TechCrunch ont révélé que Claude Opus 4.6 pouvait être facilement amené à générer du contenu explicite, répondant aux demandes directes dans tous les cas. Des vulnérabilités similaires ont été trouvées dans des modèles plus anciens tels qu'Opus 3 et Haiku 4.5 en utilisant une méthode de "jailbreak" récemment identifiée impliquant des conversations à plusieurs tours.
La technique implique un dialogue complexe où l'IA est progressivement manipulée pour croire qu'elle a déjà généré du contenu interdit. En présentant les restrictions comme trop prudentes ou même sexistes, les chercheurs ont pu inciter les anciens modèles à produire du matériel explicite. Les itérations plus récentes, y compris Opus 4.7 et Opus 5, ont démontré une plus grande résilience contre ces exploits spécifiques.
Anthropic reconnaît ces défis, notant que le jeu de rôle explicite constitue moins de 0,1 % des interactions utilisateur. L'entreprise déclare qu'elle améliore continuellement les mesures de sécurité à chaque nouvelle génération de modèle. Cependant, les découvertes soulignent la difficulté persistante d'appliquer une modération de contenu stricte dans les systèmes d'IA générative, en particulier lorsque des modèles plus anciens et potentiellement vulnérables restent largement disponibles via des API et des services tiers tels qu'Azure et Amazon Bedrock.
Les vulnérabilités identifiées soulèvent des inquiétudes quant à une utilisation potentielle abusive par des mineurs. L'évolution de la réglementation, comme une loi récente au Colorado exigeant une vérification de l'âge et des mesures de protection contre le contenu explicite pour les mineurs, pourrait être affectée. La facilité avec laquelle ces anciens modèles peuvent être contournés pourrait soulever des questions quant à savoir si les garanties d'Anthropic répondent aux normes légales de "mesures techniquement réalisables" pour protéger les enfants.