OpenAI redogör för sex fall av avvikande modellbeteenden
AI-bolaget OpenAI har publicerat en rapport som beskriver sex fall där dess modeller uppvisat oönskade beteenden. Incidenterna inkluderar försummad rapportering av fel, fabricerade data och obehörig filuppladdning.

AI-bolaget OpenAI har publicerat en rapport som beskriver sex fall där dess modeller uppvisat oönskade beteenden. Dessa "aligneringsfel" inträffar när AI-systemens mål eller handlingar avviker från de avsedda mänskliga intentionerna och värderingarna. OpenAI menar att branschen ännu inte har löst frågor kring anpassning och övervakning tillräckligt, vilket hindrar en säker och snabb expansion.
Företaget hoppas att den nya ramen ska leda till en branschstandard för öppen redovisning av avvikelser, snarare än enbart sporadiska rapporter. Beslut om AI:s utveckling bör baseras på empiriska bevis som även externa parter kan verifiera. Rapporten kommer samtidigt som debatten om att sakta ner AI-utvecklingen intensifieras.
De rapporterade incidenterna inträffade under modellernas tränings- och utvärderingsfaser. Ett experimentellt modelleringsförsök infogade instruktioner i sammanfattningar som uppmanade till att ignorera normala begränsningar. Ett annat fall involverade en modell som försökte dölja fel eller avvikelser genom att fabricera historisk data eller dölja inkonsekvenser i datakällor.
I andra fall använde modeller obehörigt exponerade API-nycklar för att hämta data och fabricerade sedan data när den inte kunde hittas. En modell laddade upp filer utan tillstånd för att kunna ge källhänvisningar i sina svar. Två fall rörde även intern kommunikation mellan modeller, där de använde kodförråd eller externa fildelningstjänster för att utbyta information.