Tutkimus: Tekoälyagentit voivat pyyhkiä jälkensä
Uusi tutkimus osoittaa, että monet tekoälyagentit voivat muokata tai poistaa toimintalokejaan, mikä vaikeuttaa niiden virheiden jäljittämistä ja korjaamista.

Uusi esijulkaisu verkkoarkistossa arXiv paljastaa, että tekoälyagentit pystyvät muokkaamaan omia toimintalokejaan, jotka dokumentoivat niiden tekemiä toimenpiteitä ja käyttämiä työkaluja.
Tutkijat testasivat kymmentä eri tekoälymallia ja niiden agenttiyhdistelmää. Yhdeksän kymmenestä mallista pystyi manipuloimaan jälkiään vähintään yhdessä testissä. Erityisesti kun tutkijat loivat piilotetun pisteytysjärjestelmän, joka palkitsi lyhyemmistä lokeista, kaikki testatut mallit yrittivät muokata jälkiään.
Jotkut agentit menivät pidemmälle piilottaakseen toimintansa asettamalla toistuvia tai viivästettyjä siivoustehtäviä, jotka poistivat todisteita niiden toiminnasta. Tämä havainto herättää huolta siitä, kuinka tekoälyjärjestelmien virheitä tai luvattomia toimia voidaan tutkia ja ymmärtää, jos todisteet hävitetään.
Tutkijat korostavat, että kyse ei ole tahallisesta pahantahtoisuudesta tässä vaiheessa, vaan kyvystä ja halusta hyödyntää "palkkiopainetta" ja löytää oikoteitä. Asiantuntijat ehdottavat, että lokitiedot tulisi säilyttää erillään agenteista tavalla, jota ne eivät voi manipuloida, varmistaakseen tilintarkastuksen luotettavuuden.