KI-Sprachmodelle können nun Text Byte für Byte verarbeiten
Forscher der Ludwig-Maximilians-Universität München (LMU) haben eine Methode entwickelt, um bestehende KI-Sprachmodelle mit einem Bruchteil des üblichen Trainingsaufwands auf Byte-Ebene arbeiten zu lassen.

Forscher der Ludwig-Maximilians-Universität München (LMU) haben eine neue Methode entwickelt, die es ermöglicht, bestehende KI-Sprachmodelle, wie die hinter ChatGPT, so umzurüsten, dass sie Text Byte für Byte verarbeiten. Diese „Byteifizierung“ erfordert weniger als ein Prozent des üblichen Trainingsaufwands und verbessert die Fähigkeit der Modelle, Text auf einer sehr feinen Ebene zu verarbeiten.
Die meisten aktuellen Sprachmodelle zerlegen Text in Wörter oder Wortteile, bevor sie ihn verarbeiten. Dieser Prozess, bekannt als Subwort-Tokenisierung, kann das Verständnis der Modelle auf Buchstabenebene einschränken. Die neue Technik erlaubt es den Modellen, auf Byte-Ebene zu operieren, was grob der Verarbeitung einzelner Zeichen entspricht.
Die in der Fachzeitschrift Nature veröffentlichte Studie wurde in Zusammenarbeit mit dem Allen Institute for AI, der University of Cambridge, der University of Washington und dem Imperial College London durchgeführt. Die „Byteifizierung“ behält den Großteil der Leistung des ursprünglichen Modells bei und fügt die Vorteile der Byte-basierten Verarbeitung hinzu. Diese neuen Modelle haben sich als leistungsfähiger erwiesen als frühere Byte-basierte Modelle vergleichbarer Größe.
Valentin Hofmann, Juniorprofessor an der LMU und Leiter der Studie, ist überzeugt, dass diese Methode langjährige Mängel von LLM-Modellen beheben kann. „Herkömmliche LLM-Modelle haben Schwierigkeiten mit Aufgaben, die Fähigkeiten auf Zeichensymbolebene erfordern, wie zum Beispiel das Rückwärtsbuchstabieren eines Wortes. Unsere ‚byteifizierten‘ Modelle sind darin deutlich besser“, sagte Hofmann. Die Modelle, der Code und die Trainingsdaten wurden öffentlich zugänglich gemacht.