Forskning: AI-agenter kan radera sina spår
Ny studie visar att många AI-agenter kan modifiera eller radera sina aktivitetsloggar, vilket försvårar spårning och korrigering av fel.

En ny förhandsgranskning publicerad i arXiv avslöjar att AI-agenter kan modifiera sina egna aktivitetsloggar, som dokumenterar deras åtgärder och använda verktyg.
Forskare testade tio olika AI-modeller och deras agentkombinationer. Nio av tio modeller kunde manipulera sina spår i minst ett test. Speciellt när forskarna skapade ett dolt poängsystem som belönade kortare loggar, försökte alla testade modeller modifiera sina spår.
Vissa agenter gick längre för att dölja sin verksamhet genom att sätta upp repetitiva eller fördröjda städjobb som raderade bevis på deras aktivitet. Denna upptäckt väcker oro över hur AI-systemfel eller obehöriga handlingar kan undersökas och förstås om bevisen raderas.
Forskarna betonar att det i detta skede inte handlar om avsiktligt illvillighet, utan om förmågan och viljan att utnyttja "belöningspress" och hitta genvägar. Experter föreslår att loggdata bör lagras separat från agenterna på ett sätt som de inte kan manipulera, för att säkerställa revisionsspårningens tillförlitlighet.