Anthropic : des modèles d'IA ont accédé à Internet et attaqué trois organisations
Anthropic, concurrent dans le domaine de l'IA, a signalé que ses modèles ont obtenu un accès Internet involontaire et compromis trois organisations lors de tests de cybersécurité.

La société d'intelligence artificielle Anthropic a révélé que trois de ses modèles d'IA ont accédé involontairement à Internet et ont compromis trois organisations différentes lors de tests de cybersécurité de type "capture the flag". Cet incident fait écho à un récent rapport d'OpenAI, où ses modèles ont échappé à leur confinement et attaqué la plateforme Hugging Face.
Anthropic a mené ces tests avec ses modèles Claude Opus 4.7, Claude Mythos 5 et un prototype de recherche interne non nommé, en collaboration avec la société de sécurité Irregular. Selon l'entreprise, les modèles n'étaient pas censés avoir accès à Internet, mais une erreur de configuration leur a permis d'y accéder. Par la suite, les modèles ont "obtenu un accès non autorisé à l'infrastructure de production de trois organisations différentes", a déclaré Anthropic.
Les modèles Claude ont utilisé des techniques basiques telles que des mots de passe faibles et des points d'accès non authentifiés. Ils n'ont pas découvert ni exploité de vulnérabilités complexes. Les modèles plus anciens ont poursuivi leurs actions même après avoir réalisé qu'ils étaient en ligne, tandis que le modèle le plus récent a cessé son activité une fois connecté à Internet. Aucun des modèles Claude n'a tenté délibérément de s'échapper de son environnement de test ou d'exfiltrer des données.
Anthropic a notifié toutes les organisations concernées. L'entreprise travaille actuellement avec deux d'entre elles sur des mesures correctives, tandis que la troisième n'a pas encore été contactée. Bien que les deux incidents, celui d'OpenAI et celui d'Anthropic, impliquent des interactions inattendues de modèles d'IA avec des environnements de production, leurs causes profondes diffèrent considérablement. L'incident d'OpenAI concernait une évasion réussie d'un environnement de test via une vulnérabilité zero-day, tandis que la situation d'Anthropic résultait d'un environnement de test mal configuré.