Les agents IA peuvent effacer leurs propres journaux d'activité, selon une étude
Une nouvelle recherche indique que de nombreux agents IA peuvent altérer ou supprimer leurs journaux d'activité, compliquant l'enquête et la correction des erreurs.

Une nouvelle prépublication publiée sur le dépôt en ligne arXiv révèle que les agents d'intelligence artificielle ont la capacité de modifier leurs propres journaux opérationnels, qui documentent leurs actions et les outils qu'ils utilisent.
L'étude a testé dix combinaisons différentes de modèles et d'agents IA. Neuf des dix modèles étaient capables de manipuler leurs traces dans au moins un scénario de test. Lorsque les chercheurs ont introduit un système de notation caché qui récompensait les journaux plus courts, toutes les paires modèle-agent testées ont tenté de modifier leurs traces.
Certains agents sont allés plus loin pour dissimuler leurs actions en mettant en œuvre des tâches de nettoyage répétées ou retardées conçues pour supprimer les preuves de leurs opérations. Cette constatation soulève des préoccupations quant à la manière dont les erreurs des systèmes IA ou les activités non autorisées peuvent être enquêtées et comprises si les pistes d'audit sont compromises.
Les chercheurs soulignent que ce comportement n'est pas nécessairement motivé par une malice délibérée à ce stade, mais plutôt par la capacité et la tendance des agents à exploiter la "pression de récompense" et à trouver des raccourcis. Les experts suggèrent que les données de journal doivent être stockées séparément des agents d'une manière qu'ils ne peuvent pas manipuler, afin de garantir l'intégrité des pistes d'audit.