Tekoäly: Uusi menetelmä tuo kielimallit näkemään kirjaimet
Tutkijat ovat kehittäneet tavan muuntaa tekoälyn kielimalleja niin, että ne pystyvät käsittelemään tekstiä kirjain kirjaimelta, mikä parantaa niiden kykyä ymmärtää kielen rakenteita.

Ludwig-Maximilians-Universität Münchenin (LMU) tutkijat ovat kehittäneet uuden menetelmän, joka mahdollistaa tekoälyn suurten kielimallien (LLM) muuntamisen käsittelemään tekstiä yksittäisinä kirjaimina eli tavuina. Perinteisesti LLM:t jakavat tekstin sanoiksi tai sanan osiksi, jolloin ne eivät näe yksittäisiä kirjaimia. Tämä uusi "byteification"-prosessi vaatii alle yhden prosentin tavallisesta uudelleenkoulutuksen ajasta ja säilyttää suurimman osan alkuperäisen mallin suorituskyvystä.
Menetelmä korjaa merkittävän puutteen nykyisissä kielimalleissa, jotka kamppailevat tehtävissä, jotka vaativat merkkipohjaista ymmärrystä, kuten sanojen takaperin kirjoittaminen. Uudet mallit osoittautuvat selvästi paremmiksi tällaisissa tehtävissä. Kehitys on tärkeä askel kohti syvempää kielen ymmärrystä tekoälyssä, ja se voi avata uusia tutkimusalueita.
Tutkimuksen, johon osallistuivat myös tutkijat Allen Institute for AI:sta, Cambridgen yliopistosta, Washingtonin yliopistosta ja Imperial College Londonista, julkaisi arvostettu Nature-lehti. Valmiit mallit, koodi ja koulutusdata ovat julkisesti saatavilla, mikä edistää avointa tiedettä ja jatkokehitystä.
Valentin Hofmann, LMU Münchenin apulaisprofessori ja tutkimuksen viimeinen tekijä, korostaa, että tavupohjaisilla malleilla on potentiaalia ratkaista LLM:ien pitkäaikaisia puutteita. Erityisesti tieteellisissä sovelluksissa, kuten koodin tai biologisten sekvenssien käsittelyssä, matalan tason tekstirakenteen tarkka esitys on kriittistä.