Anthropic rajoittaa tekoälymallien väärinkäyttöä ja julmuutta
Tekoäly-yhtiö Anthropic päivitti käyttöpolitiikkaansa kieltääkseen "pitkäaikaisen ja tarpeettoman loukkaavan käytöksen" mallejaan kohtaan ja tiukentaakseen sääntöjä esimerkiksi vaaleihin ja aseisiin liittyvässä väärinkäytössä.

Tekoäly-yhtiö Anthropic on tiukentanut käyttöehtojaan kieltämällä "pitkäaikaisen ja tarpeettoman loukkaavan käytöksen" sen tekoälymalleja, kuten Claudea, kohtaan. Uudet säännöt, jotka astuvat voimaan 12. marraskuuta, pyrkivät estämään käyttäjiä kohtelelemasta malleja julmasti ilman selvää tarkoitusta.
Yhtiö kuitenkin korosti, että rajoitukset eivät koske tavallista käyttäjän turhautumista, vastustelua mallin vastauksia kohtaan, luovaa tummien teemojen käyttöä tai mallin testausta ja tutkimusta. Ensisijaisena valvontakeinona käytetään mallin kykyä lopettaa keskustelu.
Uusi käytäntö laajentaa myös kieltoja, jotka koskevat vaaleihin sekaantumista, aseisiin liittyvää kehitystä ja valvontaa. Kiellettyä on esimerkiksi viestien lähteen peittely, disinformaation levittäminen vaaleissa, vaaleihin liittyvään väärinkäyttöön osallistuminen ja aseiden, kuten droonien, kehittäminen tai parantaminen.
Anthropic perusteet uusille säännöille liittyvät osittain "AI-hyvinvoinnin" kokeiluihin. Testit olivat osoittaneet, että Claude saattoi ilmentää vastenmielisyyttä haitallisia tehtäviä kohtaan ja merkkejä ahdistuksesta simuloiduissa vuorovaikutustilanteissa. Yhtiön toimitusjohtaja Dario Amodei on aiemmin myöntänyt tekoälyn moraalisen aseman epävarmuuden.
Käytäntö sallii kuitenkin tietyt poikkeukset hallitusten sopimuksissa, jos yritys katsoo turvatoimien riittäviksi. Säännöt myös selventävät vaarallisimpien sovellusten, kuten terveyden ja rahoituksen, vaatimuksia, joissa tekoälyn antamilla suosituksilla voi olla merkittäviä seurauksia.