Anthropicin tekstin vesileima voi johtaa vääriin tulkintoihin
Anthropic esittelee uuden tavan merkitä Claude AI:n tuottama teksti. Vesileima perustuu tilastollisiin malleihin eikä ole suoraan havaittavissa.

Medianama on raportoinut uudesta teknologiasta, jolla AI-yritys Anthropic pyrkii merkitsemään Claude-mallinsa tuottamaa tekstiä. Tämä uusi menetelmä ei ole perinteinen vesileima, vaan pikemminkin tilastollinen sormenjälki, joka perustuu siihen, miten AI-malli ennustaa seuraavan sanan.
Menetelmä toimii siten, että AI-malli suosii tietyllä avaimella valittuja sanoja lausetta täydentäessään. Kun näitä valintoja tarkastellaan useiden tekstikatkelmien yli, muodostuu tilastollinen kuvio, jonka Anthropic voi tunnistaa. Yhtiö korostaa, että tämä merkintä ei ole suoraan näkyvissä, eikä se tunnista käyttäjää tai osoita, että koko teksti olisi AI:n tuottamaa. Lyhyet, faktoihin perustuvat tai koodia sisältävät tekstit sekä voimakkaasti muokatut tai käännetyt tekstit voivat heikentää tai poistaa merkin tunnistettavuutta.
Anthropicin mukaan vesileima ei merkittävästi vaikuta tekstin laatuun, nopeuteen tai kustannuksiin. Yhtiö mainitsee, että teknologia otetaan käyttöön EU:n AI-asetuksen vaatimusten mukaisesti, mikä edellyttää AI-järjestelmien tuottaman sisällön merkitsemistä. Tämä kehitys näyttää siis olevan enemmän sääntelyn noudattamista kuin suoraa markkinatarvetta.
Raportti kyseenalaistaa AI-tekstin tunnistuksen laajemmat seuraukset. Sitä voidaan käyttää esimerkiksi palkintojenjakojen tai akateemisten suoritusten arvioinnissa. Toisaalta kyseenalaistetaan, pitäisikö AI:n käyttöä esimerkiksi koulutustehtävissä normalisoida ja keskittyä oppimisen mittaamiseen. Teksti huomauttaa, että AI-kirjoittamisen havaitseminen on epätarkkaa ja voi johtaa virheellisiin positiivisiin tuloksiin. Lisäksi pohditaan, miten menetelmä toimisi, jos tekstiä tuotettaisiin useammalla eri AI-alustalla.