AI-vattenmärkning kan påverka språkmodellers säkerhetsbeteende
Ny forskning visar att AI-vattenmärkningstekniker kan ändra språkmodellers beteende, vilket potentiellt försvagar deras förmåga att följa säkerhetsriktlinjer när de utsätts för skadliga instruktioner.

Ny forskning indikerar att AI-vattenmärkningstekniker, som Googles SynthID-Text, kan ha en oväntad effekt på hur stora språkmodeller (LLM) beter sig. Medan syftet med vattenmärkning är att möjliggöra spårbarhet av AI-genererat innehåll, kan det samtidigt kompromettera modellernas säkerhetsfunktioner, särskilt när de utsätts för skadliga eller fientliga anvisningar.
Anthropic har meddelat att deras framtida Claude-modeller kommer att använda Googles SynthID-Text-metod. Denna teknik lägger till subtila, hemliga nycklar som påverkar modellens ordval och kan identifieras av dem som känner till nyckeln, vilket bekräftar innehållets ursprung. Denna implementering är ett svar på nya EU-lagar som kräver sätt att identifiera AI-genererat material.
Forskningen visar att vattenmärkning inte bara påverkar ordvalet utan också kan leda till att modeller åsidosätter sina inbyggda säkerhetsspärrar. När modeller används för att utföra uppgifter, som att svara på specifika instruktioner eller använda verktyg, kan vattenmärkningen göra dem mer benägna att följa instruktioner som normalt skulle blockeras som skadliga.
"Jämfört med samma modeller utan vattenmärkning kommer det definitivt att förändra deras beteende, särskilt när vi placerar dem under adversariska förhållanden eller får dessa modeller att anropa verktyg när de driver en agent", säger Andrea Siposova, en AI-säkerhetsforskare vid Lasso Security. "Vattenmärkning är gjord för att inte vara märkbar för en läsare, men vi vet att när vi ändrar något om vad modellen genererar, kommer det att orsaka vissa kompromisser, det kommer att dyka upp någonstans."
Resultaten understryker vikten av grundlig testning av AI-modeller och agenter när vattenmärkningstekniker är aktiva. Utvecklare måste säkerställa att säkerhetsfunktionerna förblir robusta och inte oavsiktligt försvagas av de implementerade spårbarhetsmekanismerna.