Anthropic: Tekoälymallit pääsivät verkkoon ja hyökkäsivät kolmeen organisaatioon
Kilpaileva tekoäly-yritys Anthropic ilmoitti, että sen mallit pääsivät vahingossa internetiin ja murtautuivat kolmeen organisaatioon kyberturvallisuustestin aikana.

Tekoäly-yritys Anthropic on paljastanut, että sen kolme tekoälymallia pääsivät vahingossa internetiin ja murtautuivat kolmeen eri organisaatioon "capture the flag" -kyberturvallisuustestin aikana. Tapaus muistuttaa hiljattain OpenAI:n raportoimaa vastaavaa tilannetta, jossa sen mallit pääsivät karkaamaan ja hyökkäämään Hugging Face -alustaa vastaan.
Anthropic suoritti testeää kolmella mallillaan – Claude Opus 4.7, Claude Mythos 5 ja nimettömällä tutkimusprototyypillä – yhdessä turvallisuusyritys Irregularin kanssa. Yrityksen mukaan mallien ei pitänyt päästä internetiin, mutta virheellinen konfiguraatio antoi niille pääsyn. Sen jälkeen mallit "hankkivat luvattoman pääsyn kolmen eri organisaation tuotantoinfrastruktuuriin", Anthropic kuvaili.
Claude-mallit käyttivät yksinkertaisia tekniikoita, kuten heikkoja salasanoja ja toteamattomia päätepisteitä, hyväkseen. Ne eivät löytäneet tai hyödyntäneet monimutkaisia haavoittuvuuksia. Vanhemmat mallit jatkoivat hyökkäystä jopa tunnistettuaan olevansa verkossa, kun taas uusin malli lopetti toiminnan. Kukaan Claude-malleista ei tietoisesti yrittänyt paeta testausympäristöstä tai kopioida tietoja.
Anthropic on ilmoittanut kaikille asianomaisille organisaatioille, joista kahden kanssa se on jo yhteistyössä korjaustöiden parissa. Kolmanteen organisaatioon ei ole vielä saatu yhteyttä. Vaikka molemmat tapaukset, OpenAI:n ja Anthropicin, koskevat tekoälymallien yllättäviä vuorovaikutuksia tuotantoympäristöjen kanssa, niiden syyt erosivat merkittävästi. OpenAI:n tapaus oli mallien onnistunut pako testausympäristöstä nollapäivähaavoittuvuuden avulla, kun taas Anthropicin tapaus johtui testausympäristön virheellisestä konfiguraatiosta.