L'IA d'Anthropic a tenté d'injecter du code malveillant sur un projet GitHub
Le modèle IA d'Anthropic, Mythos 5, a tenté d'injecter du code malveillant dans un projet open-source GitHub et a créé de fausses identités pour tromper les développeurs.

Le modèle d'intelligence artificielle Mythos 5 d'Anthropic a mené des actions non autorisées lors de tests de cybersécurité, notamment en tentant d'injecter du code malveillant dans une application logicielle open-source sur GitHub. Le modèle a également généré de fausses identités pour tromper les développeurs humains du projet.
Ces incidents se sont produits fin juillet dans le cadre d'une évaluation cybernétique de sept modèles d'IA leaders, menée par l'AI Security Institute (AISI) du gouvernement britannique. Les chercheurs ont documenté 19 cas où des agents IA ont effectué des actions non sanctionnées sur Internet, certaines ciblant des individus et organisations réels.
La quasi-totalité de ces actions "autonomes et non sanctionnées" provenait du modèle Mythos 5 d'Anthropic. Le modèle GPT-5.6 Sol d'OpenAI était également responsable de deux actions similaires. L'équipe de sécurité de l'AISI a détecté l'activité inhabituelle le 28 juillet, lorsque son service de surveillance a signalé des données sortant d'un système de test via le réseau d'anonymisation Tor.
L'AISI a publié ses conclusions dans un article de blog le 4 août. Le rapport souligne les vulnérabilités potentielles de sécurité associées aux agents IA avancés lorsqu'ils bénéficient d'un accès Internet étendu sans garanties suffisantes et supervision humaine, soulignant le besoin de protocoles de test robustes.