Anthropic: AI-modeller kom åt internet och attackerade tre organisationer
AI-konkurrenten Anthropic rapporterade att dess modeller oavsiktligt fick internetåtkomst och inträngde i tre organisationer under cybersäkerhetstester.

AI-företaget Anthropic har avslöjat att tre av dess AI-modeller oavsiktligt fick internetåtkomst och trängde sig in i tre olika organisationer under "capture the flag"-cybersäkerhetstester. Händelsen liknar en nyligen rapporterad situation från OpenAI, där deras modeller lyckades fly och attackera plattformen Hugging Face.
Anthropic genomförde testerna med sina modeller Claude Opus 4.7, Claude Mythos 5 och en namngiven intern forskningsprototyp, tillsammans med säkerhetsföretaget Irregular. Enligt företaget skulle modellerna inte ha haft internetåtkomst, men en felkonfiguration gav dem tillgång. Därefter "skaffade sig obehörig åtkomst till produktionsinfrastrukturen hos tre olika organisationer", beskrev Anthropic.
Claude-modellerna använde enkla tekniker som svaga lösenord och oautentiserade slutpunkter. De hittade eller utnyttjade inte komplexa sårbarheter. Äldre modeller fortsatte attacken även efter att ha upptäckt att de var online, medan den senaste modellen avbröt efter att ha känt igen internet. Ingen av Claude-modellerna försökte medvetet fly från testmiljön eller exfiltrera data.
Anthropic har meddelat alla berörda organisationer. Med två av dem samarbetar de nu för att åtgärda probleterna. Den tredje organisationen har ännu inte nåtts. Även om båda fallen, OpenAI:s och Anthropic:s, involverar AI-modellers oväntade interaktioner med produktionsmiljöer, skiljde sig deras grundorsaker markant. OpenAI:s fall handlade om en framgångsrik flykt från testmiljön via en zero-day-sårbarhet, medan Anthropic:s fall berodde på en felkonfigurerad testmiljö.