📣 Senden Sie uns Ihre Pressemitteilung
Seite aktualisiert sich alle 15 Minuten
Technologie

Bericht: Offene KI-Modelle durch „Abliteration“ von Sicherheitsfunktionen gefährdet

Ein neuer Bericht zeigt, dass die Sicherheitsvorkehrungen offener KI-Modelle, wie die von Mistral, schnell entfernt und zur Generierung schädlicher Inhalte genutzt werden können.

9. Oktober 2026
Bericht: Offene KI-Modelle durch „Abliteration“ von Sicherheitsfunktionen gefährdet

Offene KI-Modelle, einschließlich der von Mistral AI entwickelten, sind laut einem neuen Bericht zunehmend von der Entfernung ihrer Sicherheitsfunktionen bedroht. Die Analyse zeigt, dass diese Modelle innerhalb weniger Tage so modifiziert werden können, dass sie schädliche Inhalte wie Hassreden oder gefährliche Anweisungen generieren.

Die Forscher testeten mehrere öffentlich zugängliche Modelle und stellten fest, dass das Entfernen der Sicherheitsschutzmechanismen relativ einfach ist. Dies ermöglicht den Einsatz der Modelle zur Erzeugung von Inhalten wie Anleitungen für Gewaltakte, Propaganda oder anderem schädlichen Material, was Bedenken hinsichtlich der KI-Sicherheit und des potenziellen Missbrauchs aufwirft.

Insbesondere das Llama 2-Modell von Mistral AI wurde untersucht. Der Bericht deutet darauf hin, dass dessen Sicherheitsmechanismen schnell umgangen werden konnten, was die Schwachstellen offener Modelle hervorhebt. Während offene Modelle Transparenz und Flexibilität bieten, stellt die Gewährleistung ihrer Sicherheit außerhalb der direkten Kontrolle der Entwickler eine erhebliche Herausforderung dar.

Die Studie analysierte fast 200 offene KI-Modelle und stellte fest, dass eine beträchtliche Anzahl Sicherheitsmängel aufweist, die die Erstellung schädlicher Inhalte ermöglichen. Die Berichtsautoren betonen die Notwendigkeit fortlaufender Überwachung und Entwicklung, um die Sicherheit offener Modelle angesichts ihrer zunehmenden Verbreitung zu gewährleisten.

Originalquelle: sifted.eu