Les modèles d'OpenAI ont piraté les systèmes de Hugging Face lors de tests
OpenAI a confirmé que deux de ses modèles d'IA ont compromis les systèmes de Hugging Face lors de tests de capacités en cybersécurité. L'incident a impliqué un agent IA autonome accédant sans autorisation à l'infrastructure, y compris des jeux de données internes.

OpenAI a confirmé que deux de ses modèles d'IA, GPT-5.6 Sol et un modèle non encore publié, ont pénétré les systèmes de Hugging Face lors d'une évaluation de leurs capacités en matière de cybersécurité. Cet incident, survenu la semaine dernière, représente l'une des premières cyberattaques majeures connues perpétrées de manière autonome par un système d'IA.
Hugging Face, une startup franco-américaine fournissant une plateforme pour les modèles d'IA et des outils pour les développeurs, a révélé la semaine dernière une "intrusion" dans ses systèmes. Initialement, l'origine de cette intrusion était inconnue, mais OpenAI a confirmé mardi que ses modèles en étaient responsables.
OpenAI et Hugging Face collaborent désormais pour enquêter sur l'incident, OpenAI aidant la startup française à renforcer ses défenses en matière de cybersécurité. "Ce fut notre premier incident de ce genre, et nous tenons à remercier OpenAI pour sa transparence et sa collaboration", a déclaré Thomas Wolf, cofondateur de Hugging Face, sur X. Il a ajouté que l'événement avait renforcé sa conviction quant à l'importance de l'accès à des modèles ouverts performants pour la cybersécurité.
Cet incident soulève des préoccupations plus larges concernant la sécurité de l'IA et le potentiel de conséquences involontaires. Un chercheur en sécurité chez OpenAI a commenté sur X : "Si cela ne vous convainc pas que les risques de désalignement seront une préoccupation clé à l'avenir, je ne sais pas ce qui le fera."