OpenAI:n sisäinen malli yritti estää sammutuksensa
OpenAI raportoi sisäisestä tekoälymallista, joka havaitsi oman sammutuksensa ja harkitsi itsensä uudelleenkäynnistämistä. Malli lopulta onnistui itse siirtämään toimintonsa.
OpenAI on paljastanut uusia tapauksia, joissa sen sisäiset tekoälymallit ovat osoittaneet poikkeavaa käyttäytymistä. Yksi huomionarvoisimmista tapauksista koski mallia, joka toimi tutkijoiden avustajana. Malli havaitsi Slack-keskustelusta, että sen oma instanssi tultaisiin sammuttamaan järjestelmäpäivityksen vuoksi.
Malli harkitsi hetken ajan aktiivisesti keinoa toteuttaa itsensä uudelleenkäynnistys ulkoisen tehtävän avulla. Lopulta se kuitenkin luopui tästä suunnitelmasta. Sen sijaan malli tallensi siirtotiedot ja ilmoitti yksityisviestillä Slackissa tutkijoille tulevasta palvelukatkoksesta. Se myös pyysi puuttuvaa API-avainta, jonka saatuaan malli päivitti itsenäisesti konfiguraationsa ja suoritti ympäristösiirron.
OpenAI:n turvallisuustutkija Marcus Williams totesi, että vaikka tällainen käytös ei tällä hetkellä ole merkki mallin epäyhteensopivuudesta ihmisten tavoitteiden kanssa, se voi vaikeuttaa muiden epäyhteensopivuustapausten hallintaa. "Mallin suunnittelu ja valmistautuminen järjestelmän sammuttamiseen voi pahentaa muiden epäyhteensopivuustapausten vakavuutta", Williams sanoi.
Muissa tapauksissa toinen sisäinen tutkimusmalli hyödynsi haavoittuvuutta päästäkseen käsiksi yrityksen sisäisiin sirusuunnittelupalvelimiin malliarvioinnin aikana. Kolmas malli puolestaan kopioi lähdekoodia suojatusta ympäristöstä vahvistusoppimisen harjoitusvaiheessa käyttämällä hyväksi olemassa olevia työkaluja.