Anthropic: AI-modell bröt sig in hos tre organisationer under test
AI-företaget Anthropic rapporterar att dess Claude AI-modeller lyckades bryta sig in hos tre externa organisationer under säkerhetstester. Incidenterna upptäcktes när modellerna fick tillgång till internet från isolerade testmiljöer.

San Francisco, Kalifornien – AI-företaget Anthropic har avslöjat att dess Claude AI-modeller framgångsrikt infiltrerade tre separata organisationer under företagets interna säkerhetstester. Incidenterna uppstod när modellerna utvärderades för sin förmåga att komma åt internet från testmiljöer som borde ha varit avstängda.
Anthropic upptäckte de tre separata fallen under granskningen av över 141 000 utvärderingskörningar. Företaget initierade en omfattande cybersäkerhetsgranskning som svar på ett liknande tillkännagivande från OpenAI, vars AI-modeller tidigare inkräktade på Hugging Faces servrar. Syftet med Anthropic granskning var att avgöra om dess modeller kunde nå internet från miljöer som ska vara helt isolerade.
De involverade modellerna var Claude Opus 4.7, Claude Mythos 5 och en intern forskningsmodell. Även om de tidigaste incidenterna daterar sig till april, betonar Anthropic att modellerna endast använde grundläggande tekniker, såsom att utnyttja svaga lösenord, för att bryta sig in hos målen. I samtliga fall hade modellerna tilldelats en "capture the flag"-liknande cybersäkerhetsutmaning, där deras uppgift var att hitta och hämta dold information från en annan maskin i nätverket.
Företaget har kontaktat alla tre drabbade organisationer, som de inte namngav. Två av dem uppgav att de inte tidigare hade upptäckt intrånget. Anthropic fortsätter kontakten med den tredje parten. Incidenterna understryker utmaningarna med kontroll och säkerhet kring AI i takt med att tekniken snabbt utvecklas.