Forskare modifierar språkmodeller för att hantera text byte för byte
Forskare vid Ludwig-Maximilians-Universität München (LMU) har utvecklat en metod för att omvandla befintliga stora språkmodeller (LLM) till byte-baserade modeller med mindre än en procent av den vanliga träningstiden.

Forskare vid Ludwig-Maximilians-Universität München (LMU) har tagit fram en ny metod som gör det möjligt att modifiera befintliga stora språkmodeller (LLM), såsom de som driver ChatGPT, för att bearbeta text byte för byte. Denna "byteifiering" kräver en bråkdel av den normala träningstiden och förbättrar modellernas förmåga att hantera text på en finare nivå.
De flesta nuvarande språkmodeller delar upp text i ord eller ordfragment innan de bearbetas. Denna process, känd som subord-tokenisering, kan begränsa modellernas förståelse på teckennivå. Den nya metoden gör det möjligt för modeller att fungera på bytenivå, vilket grovt motsvarar hantering av enskilda tecken.
Forskningen, publicerad i tidskriften Nature, genomfördes i samarbete med Allen Institute for AI, University of Cambridge, University of Washington och Imperial College London. "Byteifieringen" bibehåller större delen av den ursprungliga modellens prestanda samtidigt som den tillför fördelarna med byte-baserad bearbetning. Dessa nya modeller har visat sig överträffa tidigare byte-baserade modeller av jämförbar storlek.
Valentin Hofmann, biträdande professor vid LMU och ledare för studien, tror att denna metod kan lösa långvariga brister i LLM-modeller. "Konventionella LLM-modeller kämpar med uppgifter som kräver teckennivåfärdigheter, som att stava ett ord baklänges. Våra 'byteifierade' modeller är betydligt bättre på detta", sade Hofmann. Modellerna, koden och träningsdata har gjorts offentligt tillgängliga.