📣 Senden Sie uns Ihre Pressemitteilung
Seite aktualisiert sich alle 15 Minuten
Wissenschaft

KI: Sprachmodelle können nun einzelne Buchstaben verarbeiten

Forscher haben eine Methode entwickelt, um bestehende KI-Sprachmodelle so umzurüsten, dass sie Text auf Byte-Ebene verarbeiten und dabei ihre Sprachverständnisfähigkeiten verbessern.

11. Oktober 2026
KI: Sprachmodelle können nun einzelne Buchstaben verarbeiten

Forscher der Ludwig-Maximilians-Universität München (LMU) haben ein neues Verfahren entwickelt, das große Sprachmodelle (LLMs) befähigt, Text auf der Ebene einzelner Zeichen, sogenannter Bytes, zu verarbeiten. Im Gegensatz zu herkömmlichen LLMs, die Text in Wörter oder Wortteile zerlegen und dabei die einzelnen Buchstaben nicht direkt sehen, rüstet dieses neue „Byteification“-Verfahren bestehende Modelle nach. Der Prozess erfordert weniger als ein Prozent der üblichen Kosten für ein vollständiges Neutraining und erhält dabei die Leistung des ursprünglichen Modells weitgehend.

Diese Entwicklung behebt eine wesentliche Einschränkung aktueller LLMs, die Schwierigkeiten bei Aufgaben haben, welche ein zeichenbasiertes Verständnis erfordern, wie zum Beispiel das Rückwärtsbuchstabieren von Wörtern. Die umgerüsteten Modelle zeigen in diesen spezifischen Bereichen eine überlegene Leistung. Der Fortschritt gilt als wichtiger Schritt zu einem tieferen Sprachverständnis in der künstlichen Intelligenz und soll neue Forschungsrichtungen eröffnen.

Die Studie, eine Kooperation zwischen Forschern der LMU, des Allen Institute for AI, der University of Cambridge, der University of Washington und des Imperial College London, wurde in der Fachzeitschrift Nature veröffentlicht. Die resultierenden Modelle sowie der Code und die Trainingsdaten sind öffentlich zugänglich, was offene Wissenschaft und zukünftige Entwicklung fördert.

Valentin Hofmann, Juniorprofessor an der LMU München und Letztautor der Studie, erklärte, dass Byte-basierte LLMs das Potenzial haben, langjährige Schwächen zu überwinden. Er betonte, dass eine präzise Darstellung von Textstrukturen auf niedriger Ebene für viele wissenschaftliche Anwendungen, einschließlich der Arbeit mit Code oder biologischen Sequenzen, entscheidend ist.

Originalquelle: lmu.de