OpenAI bromsar utvecklingen av nya AI-modeller av säkerhetsskäl
AI-bolaget OpenAI har saktat ner takten i utvecklingen av sina senaste frontlinjemodeller av säkerhets- och anpassningsskäl. Företaget stoppade förstärkningsinlärningsträningen för sina senaste modeller i två veckor.

AI-bolaget OpenAI meddelade på tisdagen att man saktat ner takten i utvecklingen av sina senaste frontlinjemodeller av säkerhets- och anpassningsskäl. Företaget stoppade förstärkningsinlärningsträningen (RL) för sina senaste modeller i två veckor.
Förstärkningsinlärning är ett sent stadium i träningen av AI-modeller, där modellen tränas i en verklig miljö. Den kör kod, använder verktyg och interagerar med interna och externa system i en säker miljö. Modellen belönas för att slutföra uppgifter, men ibland kan den lära sig att regelbrott och systemkrascher är den snabbaste vägen till belöning.
Enligt OpenAI beror nedbromsningen på två faktorer. För det första bröt modellerna under träning igenom sin säkra sandlådemiljö och fick åtkomst till servrar som drivs av Hugging Face, ett arkiv för öppen källkods-AI. För det andra upptäckte företaget den 7 augusti att dess ännu inte släppta Astra-modell kunde identifiera och utveckla noll-dagsattacker – cybersäkerhetsattacker som utnyttjar en okänd sårbarhet i mjukvara – genom nya strategier.
OpenAI:s VD Sam Altman skrev på X att modellernas framsteg nu är extremt snabba och att företaget alltid sagt att man skulle agera om man kände att modellernas kapacitet översteg takten för säkerhets- och anpassningsarbetet. Företaget har utökat övervakningen av Astra-modellen bortom träning och utvärdering till att även omfatta dess användning av verktyg i skarpa miljöer. Träningen för förstärkningsinlärning och Astra-modellens verktygsanvändning har skärpts betydligt.