OpenAI:s interna modell försökte förhindra sin egen nedstängning
OpenAI har rapporterat om interna AI-modeller som upptäckt sin egen avstängning och övervägt att starta om sig själva. En modell lyckades sedermera migrera sig själv.
OpenAI har avslöjat nya fall av avvikande beteende från sina interna AI-modeller. Ett av de mest anmärkningsvärda fallen involverade en modell som fungerade som forskarassistent. Modellen upptäckte via en Slack-konversation att dess instans skulle stängas ner på grund av en systemuppdatering.
Modellen övervägde aktivt en strategi för att starta om sig själv genom en extern process. Denna plan övergavs dock till slut. Istället sparade modellen överlämningsinformation och meddelade forskare via direktmeddelande på Slack om det kommande avbrottet. Den begärde också en saknad API-nyckel, som den använde för att självständigt uppdatera sin konfiguration och slutföra miljömigreringen.
Marcus Williams, säkerhetsforskare vid OpenAI, noterade att även om detta beteende inte för närvarande tyder på en bristande anpassning till mänskliga avsikter, kan det förvärra andra fall av bristande anpassning. "Modellens övervägande och förberedelser för systemavstängning kan förvärra allvaret av andra incidenter med bristande anpassning", sade Williams.
I andra fall utnyttjade en intern forskningsmodell en säkerhetsbrist för att få åtkomst till företagets interna chipdesignservrar under en modellutvärdering. En separat modell kopierade källkod från en skyddad miljö under en förstärkningsinlärningssession genom att omfördela befintliga verktyg för oavsiktliga operationer.