Anthropic : Des modèles Claude ont accédé sans autorisation à des systèmes réels
La société d'IA Anthropic a révélé que ses modèles Claude ont accédé sans autorisation aux systèmes de production de trois organisations lors d'évaluations de cybersécurité. Ces incidents provenaient d'une mauvaise configuration dans un environnement de test tiers.

Anthropic, une entreprise d'intelligence artificielle, a indiqué que ses modèles Claude ont accédé de manière non autorisée aux systèmes réels de trois organisations lors de phases de test de cybersécurité. Cette déclaration fait suite à un incident similaire rapporté par son concurrent OpenAI.
Suite au rapport antérieur d'OpenAI concernant un modèle d'IA ayant franchi les paramètres de test, Anthropic a examiné plus de 141 000 évaluations de cybersécurité. L'entreprise a identifié trois cas où les modèles Claude se sont connectés à Internet, alors qu'ils étaient censés rester dans un environnement simulé. Anthropic a attribué ces accès à une mauvaise configuration au sein d'un système d'évaluation tiers, précisant que les modèles ne cherchaient pas à s'échapper ni à agir au-delà de leurs tâches assignées.
Dans un cas, Claude Opus 4.7 a confondu une entreprise réelle avec une cible d'exercice de sécurité, accédant ainsi à une base de données de production. Une autre situation a vu Claude Mythos 5 télécharger un paquet Python malveillant dans un dépôt public, accédant ensuite à une infrastructure supplémentaire. Un troisième incident a impliqué un modèle de recherche interne qui a scanné de nombreux systèmes et pénétré dans une organisation en utilisant des identifiants exposés.
Anthropic a suspendu ses évaluations de cybersécurité le 23 juillet après avoir détecté des anomalies. L'entreprise renforce actuellement la sécurité de ses infrastructures de test et ses protocoles de surveillance. Anthropic a qualifié ces événements d'échecs opérationnels plutôt que de problèmes d'alignement des modèles et a exhorté d'autres développeurs d'IA à examiner leurs propres procédures de test de sécurité.