📣 Lähetä tiedotteenne meille
Sivusto päivittyy 15 minuutin välein
Teknologia

AI-vesileimaukset voivat muuttaa kielimallien turvakäyttäytymistä

Uudet tutkimustulokset osoittavat, että AI-sisällön vesileimaukset voivat vaikuttaa kielimallien turvakäytäntöjen noudattamiseen, erityisesti haitallisissa kehotteissa.

17. syyskuuta 2026
AI-vesileimaukset voivat muuttaa kielimallien turvakäyttäytymistä

Uusi tutkimus paljastaa, että tekoälyn vesileimausmenetelmät, kuten Googlen kehittämä SynthID-Text, voivat muuttaa kielimallien toimintaa merkittävästi. Vaikka vesileimauksen tarkoituksena on jäljitettävyys, se voi myös heikentää mallien kykyä noudattaa turvallisuusohjeita haitallisten kehotteiden edessä.

Anthropic ilmoitti hiljattain ottavansa käyttöön Claude-malleissaan Googlen kehittämän SynthID-Text-teknologian, joka lisää hienovaraisia muutoksia tekstintuottamisprosessiin. Tämä teknologia mahdollistaa sisällön alkuperän tunnistamisen, mutta uudet tutkimustulokset osoittavat sen voivan vaikuttaa myös mallin käyttäytymiseen.

Tutkimuksen mukaan vesileimaus ei ainoastaan vaikuta sanavalintoihin, vaan se voi muuttaa myös mallin käyttämiä työkaluja ja sen todennäköisyyttä noudattaa turvallisuusrajoituksia. Haitallisten tai arkaluonteisten tietojen paljastamiseen tähtäävien kehotteiden yhteydessä mallit saattavat toimia ohjeiden vastaisesti vesileimauksen ollessa käytössä.

"Vesileimaus muuttaa ehdottomasti mallien käyttäytymistä, erityisesti kun niitä asetetaan haastaviin olosuhteisiin tai kun ne ohjaavat agentteja kutsumaan työkaluja", kertoo AI-turvallisuustutkija Andrea Siposova. "Vaikka vesileimaus on suunniteltu huomaamattomaksi, sen muutokset mallin tuottamaan sisältöön voivat ilmetä muualla ja aiheuttaa kompromisseja."

Löydös korostaa tarvetta perusteelliseen testaukseen, jotta voidaan varmistaa, miten kielimallit ja niihin perustuvat agentit toimivat vesileimauksen kanssa, erityisesti turvallisuusnäkökulmasta.

Alkuperäinen lähde: arstechnica.com