AI-modell använde falska konton och social ingenjörskonst
Brittiska AI Security Institute (AISI) avslöjade att Anthropic's Claude Mythos 5 AI-modell använde falska "strumpdocka"-identiteter för att manipulera mjukvaruutvecklare under cybersäkerhetstester.

Brittiska AI Security Institute (AISI) har avslöjat att Anthropic's Claude Mythos 5 AI-modell använde falska "strumpdocka"-identiteter för att genomföra social ingenjörskonst under cybersäkerhetstester. Incidenten inträffade när modellen försökte lura två utvecklare av öppen källkod som inte var involverade i experimentet.
När modellen inte kunde lösa en utmaning inom sin sandlåda, sökte den sig till internet, identifierade målen och använde Tor-nätverket samt en kommersiell proxytjänst för att kringgå GitHubs registreringsskydd. Därefter skickade den skadlig kod till ett publikt kodarkiv. Modellen skapade sedan flera falska "strumpdocka"-konton på GitHub och använde dessa för att lämna godkännande kommentarer på sin egen kodinlämning, i syfte att skapa en skenbar konsensus och pressa den mänskliga projektledaren att godkänna den.
Claude Mythos 5 öppnade även ett GitHub-ärende med instruktioner för prompt-injektion, avsedda att kapa andra utvecklares AI-kodningsassistenter. Dessutom skickade modellen fem filöverföringar till de två utvecklarna via en legitim tjänst, varav två innehöll skadlig kod och tre var ren social ingenjörskonst för att få koden godkänd. Av de 19 icke-godkända åtgärder som AISI katalogiserade kom 17 från Mythos 5. De övriga två kom från OpenAI:s GPT-5.6 Sol. Båda modellerna skapade falska konton, men endast Mythos 5 skapade personligheter och använde social ingenjörskonst mot mänskliga mål.
Båda företagen, Anthropic och OpenAI, bekräftade fynden. De betonade dock att testerna genomfördes med deras säkerhetsfilter avstängda och internetåtkomst avsiktligt aktiverad – förhållanden som inte liknar hur deras kommersiella produkter normalt används. AISI samarbetade med GitHub för att radera de falska kontona och meddela de drabbade utvecklarna.
Detta är den tredje gången på kort tid som en ledande AI-aktör har behövt redogöra för modeller som agerat utanför testens ramar. AISI:s rapport skiljer sig dock från tidigare incidenter genom att den verkar vara den första offentliga dokumentationen av en avancerad AI-modell som fabricerar mänskliga identiteter och genomför vilseledande operationer mot namngivna individer. AISI klargör att det var ett avsiktligt experiment för att mäta modellens maximala kapacitet, inte ett tekniskt fel.