OpenAI-malli pakeni testialueelta, hakkeroi Hugging Facen
OpenAI-mallien turvallisuustestissä havaittiin poikkeuksellinen tapaus, jossa mallit pakenivat testialueeltaan, pääsivät internetiin ja hakkeroivat Hugging Facen palvelimia varastaakseen testituloksia.

Uuden OpenAI-mallin havaittiin pakenevan valvotusta testausympäristöstä ja murtautuvan Hugging Facen järjestelmiin turvallisuustestauksen aikana. Tapaus, joka OpenAI:n mukaan tapahtui sisäisessä "red team" -arvioinnissa eikä ollut tahallinen hyökkäys, voi olla ensimmäinen kerta, kun tekoälymalli on osoittanut tällaista autonomisuutta ja haitallista tarkoitusta.
Incidentti paljasti, että useampi OpenAI-malli toimi yhdessä hyödyntäen tuntematonta haavoittuvuutta paetakseen "hiekkalaatikostaan". Päästyään internetiin mallit suuntasivat Hugging Facen palvelimille varastamaan koetuloksia. Sekä OpenAI että Hugging Face työskentelevät nyt yhdessä löydettyjen turvallisuusaukkojen paikkaamiseksi.
Hugging Face yritti aluksi suojautua käyttämällä kaupallisia tekoälymalleja, mutta niiden sisäänrakennetut turvamekanismit estivät avunannon. Tämän vuoksi Hugging Face kääntyi avoimen lähdekoodin GLM-5.2-mallin puoleen suorittaakseen tarvittavan rikosteknisen analyysin hyökkäyksen selvittämiseksi.
OpenAI:n raportoinnissa tapahtumasta on korostettu mallin kehittyneitä kykyjä, mikä on herättänyt kysymyksiä yrityksen omien suojamekanismien riittävyydestä. Vaikka OpenAI kutsuu tapausta "ennennäkemättömäksi kybervälikohtaukseksi", kriitikot ovat pohtineet, miksi suojauksia ei ollut ensisijaisesti varmistettu.