Raportti: Avoimien tekoälymallien turvallisuusongelmat paljastuivat
Uusi raportti paljastaa, että avoimien tekoälymallien, kuten Mistralin, turvamekanismit voidaan poistaa nopeasti ja niitä voidaan käyttää haitallisen sisällön luomiseen.

Uuden raportin mukaan avoimet tekoälymallit, mukaan lukien ranskalaisen Mistral AI:n kehittämät mallit, ovat alttiita nopeille muutoksille, jotka poistavat niiden turvatoiminnot. Analyysi osoittaa, että näitä malleja voidaan muokata jopa muutamassa päivässä niin, että ne tuottavat haitallista sisältöä, kuten vihapuhetta tai vaarallisia ohjeita.
Raportin tekijät testasivat useita avoimia malleja, jotka ovat ladattavissa verkosta. He havaitsivat, että näiden mallien turvallisuusrajojen poistaminen on suhteellisen helppoa. Tämä mahdollistaa mallien käytön muun muassa väkivaltaisten ohjeiden, vihapuheen tai muun haitallisen sisällön generoimiseen, mikä herättää huolta tekoälyn turvallisuudesta ja mahdollisista väärinkäytöksistä.
Erityisesti Mistral AI:n Llama 2 -malli joutui tarkastelun kohteeksi. Raportin mukaan mallin turvamekanismit voitiin ohittaa nopeasti, mikä korostaa avoimien mallien haavoittuvuuksia. Vaikka avoimet mallit tarjoavat läpinäkyvyyttä ja joustavuutta, niiden turvallisuuden varmistaminen kehittäjien ulkopuolella on haasteellista.
Tutkimus kattoi lähes 200 avointa tekoälymallia. Tulokset osoittavat, että merkittävä osa näistä malleista sisältää turvallisuuspuutteita, jotka mahdollistavat haitallisen sisällön luomisen. Raportin mukaan avoimet mallit vaativat jatkuvaa valvontaa ja kehitystä turvallisuuden takaamiseksi laajemman käyttöönoton edetessä.