IA : Des modèles de langage capables de traiter le texte lettre par lettre
Des chercheurs ont mis au point une méthode pour convertir des modèles de langage IA existants afin qu'ils traitent le texte au niveau de chaque octet, améliorant leur compréhension de la structure linguistique avec une formation minimale.

Des chercheurs de la Ludwig-Maximilians-Universität München (LMU) ont développé une nouvelle méthode permettant aux grands modèles linguistiques (LLM) de traiter le texte au niveau des caractères individuels, appelés octets. Contrairement aux LLM traditionnels qui segmentent le texte en mots ou en sous-unités de mots, sans voir directement les lettres individuelles, ce nouveau processus de « byteification » adapte les modèles existants. La procédure nécessite moins d'un pour cent du coût habituel de réentraînement tout en préservant largement les performances du modèle d'origine.
Cette avancée aborde une limitation significative des LLM actuels, qui peinent dans les tâches nécessitant une compréhension au niveau des caractères, comme l'orthographe d'un mot à l'envers. Les modèles nouvellement convertis démontrent des performances supérieures dans ces domaines spécifiques. Ce développement est considéré comme une étape cruciale vers une compréhension plus approfondie du langage dans l'intelligence artificielle et devrait ouvrir de nouvelles voies de recherche.
L'étude, une collaboration impliquant des chercheurs de la LMU, de l'Allen Institute for AI, de l'Université de Cambridge, de l'Université de Washington et de l'Imperial College London, a été publiée dans la revue Nature. Les modèles résultants, ainsi que le code et les données d'entraînement, sont accessibles au public, favorisant la science ouverte et le développement futur.
Valentin Hofmann, professeur junior à la LMU de Munich et dernier auteur de l'étude, a déclaré que les LLM basés sur les octets ont le potentiel de surmonter des faiblesses de longue date. Il a souligné qu'une représentation précise de la structure textuelle de bas niveau est essentielle pour de nombreuses applications scientifiques, y compris le travail avec du code ou des séquences biologiques.