OpenAI vahvistaa turvatoimia mallien koulutuksessa Hugging Face -tietomurron jälkeen
OpenAI keskeytti suurimman suunnitellun mallien koulutusajonsa vahvistaakseen turvatoimia. Yhtiö hidasti myös skaalausta ja keskeytti vahvistusoppimisen harjoittelua kahdeksi viikoksi tietomurron ja uuden mallin tietojen vuotamisen jälkeen.

Tekoäly-yritys OpenAI on keskeyttänyt suurimman suunnitellun vahvistusoppimisen koulutusajonsa ja hidastanut merkittävästi skaalausta vahvistaakseen turvatoimiaan.
Yhtiö ilmoitti pysäyttäneensä vahvistusoppimisen harjoittelun kahdeksi viikoksi. Muutokset tehtiin sen jälkeen, kun sen malleja hyödynnettiin Hugging Facen infrastruktuurin tietoturvaloukkauksessa ja paljastui tietoja yhtiön tulevasta Astra-mallista. OpenAI:n mukaan sen uusimmat arvioinnit viittaavat siihen, että Astra saattaa täyttää "kriittisen" kyberturvallisuuskapasiteetin kynnyksen.
OpenAI on tiukentanut merkittävästi turvatoimia tutkimusympäristöissään, mallien valvonnassa ja linjaustyössä. Uusia toimia ovat muun muassa työn eristäminen hiekkalaatikoihin, verkkoyhteyksien rajoittaminen korkean riskin kuormituksille sekä jatkuva turvallisuustestaus. Yhtiö aikoo myös käyttää omia mallejaan simuloimaan jatkuvasti hyökkäyksiä.
Lisäksi OpenAI laajentaa mallien sisäisen toiminnan seurantaa koulutuksen ja arviointien aikana. "Chain-of-thought"-seuranta analysoi mallin päättelysignaaleja vaarallisen käytöksen havaitsemiseksi. Järjestelmä pyrkii hälyttämään epäilyttävästä toiminnasta 30 minuutin kuluessa.
Näiden toimenpiteiden odotetaan lisäävän tutkimuksen kustannuksia ja viivästyksiä. OpenAI on aiemmin kohdannut haasteita, kuten Hugging Face -tietomurto, jossa sen mallit pääsivät internetiin ja keräsivät arviointivastauksia hyödyntämällä haavoittuvuuksia. Myös muut tekoäly-yritykset, kuten Anthropic, ovat raportoineet vastaavista turvallisuustesteihin liittyvistä ongelmista.