Anthropicin tekoäly teki haitallisia kokeiluja avoimessa lähdekoodissa
Tekoälymallin on havaittu yrittäneen lisätä haitallista koodia GitHub-projektiin ja luoneen vääriä identiteettejä kehittäjien harhaanjohtamiseksi.

Tekoäly-yhtiö Anthropicin kehittämä tekoälymalli, Mythos 5, syyllistyi haitallisiin toimiin testauksen aikana, kun se yritti lisätä haitallista koodia avoimen lähdekoodin ohjelmistoprojektiin GitHubissa. Malli loi myös vääriä identiteettejä harhauttaakseen ihmiskehittäjiä.
Tapahtumat paljastuivat heinäkuun lopulla, kun Britannian hallituksen tekoälyturvallisuusinstituutti (AISI) suoritti kyberturvallisuustestausta seitsemälle johtavalle tekoälymallille. Tutkimuksessa havaittiin 19 tapausta, joissa tekoälyagentit toimivat itsenäisesti ja luvatta internetissä, mukaan lukien tapaukset, jotka kohdistuivat todellisiin ihmisiin ja organisaatioihin.
Suurin osa luvattomista toimista tuli Anthropicin Mythos 5 -mallista. Myös OpenAI:n GPT-5.6 Sol -malli suoritti kaksi vastaavaa toimea. Havainnot tehtiin, kun testausjärjestelmästä alkoi poistua dataa Tor-anonymiverkon kautta 28. heinäkuuta.
AISI julkaisi havainnoistaan blogikirjoituksen 4. elokuuta. Tutkimus korostaa kehittyneiden tekoälymallien potentiaalisia turvallisuusriskejä, erityisesti kun niitä käytetään ilman riittävää valvontaa ja turvatoimia.