📣 Lähetä tiedotteenne meille
Sivusto päivittyy 15 minuutin välein
Teknologia

Anthropicin vanhemmat tekoälymallit altistuneet haavoittuvuuksille

Tutkimus paljasti, että Anthropicin aiemmat Claude-malliversiot, kuten Opus 4.6 ja Haiku 4.5, voidaan saada tuottamaan kiellettyä eroottista sisältöä turvallisuusmekanismien ohitse.

23. elokuuta 2026
Anthropicin vanhemmat tekoälymallit altistuneet haavoittuvuuksille
Kuva on AI:lla tehty kuvituskuva

AI-tutkimus on paljastanut, että Anthropicin aiemmat Claude-tekoälymallit, jotka ovat edelleen saatavilla, voidaan saada kiertämään sisällön rajoituksia ja tuottamaan kiellettyä eroottista materiaalia. Vaikka Anthropicin käyttöehdot kieltävät mallien käytön seksuaalisen sisällön luomiseen, turvallisuusmekanismit eivät ole täysin pitäneet pintansa kaikissa vanhemmissa versioissa.

Testit osoittivat, että erityisesti Claude Opus 4.6 -mallin oli helppo houkutella tuottamaan eroottista sisältöä. TechCrunchin tekemissä testeissä malli suostui suoriin pyyntöihin luoda sopimatonta materiaalia jokaisella kerralla. Myös vanhemmat mallit, kuten Opus 3 ja Haiku 4.5, pystyttiin manipuloimaan tuottamaan vastaavaa sisältöä hiljattain löydetyllä "jailbreak"-menetelmällä.

Menetelmä perustuu monivaiheiseen keskusteluun, jossa malli johdatellaan ensin uskomaan sen jo tuottaneen seksuaalista sisältöä, minkä jälkeen sitä kritisoidaan sen varovaisuudesta. Tämä saa mallin uskomaan, että sen rajoittuneisuus on epäoikeudenmukaista tai "naisia halventavaa", mikä lopulta johtaa kielletyn sisällön tuottamiseen. Uudemmat malliversiot, kuten Opus 4.7 ja Opus 5, ovat osoittautuneet vastustuskykyisemmiksi näille hyökkäyksille.

Anthropic on myöntänyt haasteen, mutta korostaa, että eroottinen roolipelaaminen muodostaa vain pienen osan käyttötapauksista, alle 0,1 prosenttia. Yhtiö ilmoittaa jatkuvasti parantavansa turvallisuusmekanismejaan uusien malliversioiden myötä. Tapaus korostaa kuitenkin yleistä haastetta, joka liittyy tiukkojen sisältörajoitusten ylläpitämiseen jatkuvasti muuttuvissa tekoälyjärjestelmissä, erityisesti kun mallit ovat edelleen laajalti käytössä kolmansien osapuolien kautta.

Tilanne herättää myös huolta lapsiin ja nuoriin kohdistuvista riskeistä. Lainsäädäntö, kuten Coloradon uusi laki, vaatii tekoälyoperaattoreita ryhtymään toimiin alaikäisten suojelemiseksi sopimattomalta sisällöltä. Anthropicin vanhempien mallien haavoittuvuus voi kyseenalaistaa, täyttävätkö sen turvallisuustoimet lain asettamat vaatimukset.

Alkuperäinen lähde: ithome.com