📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

Des modèles linguistiques d'IA modifiés pour traiter le texte octet par octet

Des chercheurs de la Ludwig-Maximilians-Universität München (LMU) ont mis au point une méthode pour convertir des grands modèles linguistiques (LLM) existants en modèles au niveau de l'octet, avec moins de 1 % de l'effort d'entraînement habituel.

9 octobre 2026
Des modèles linguistiques d'IA modifiés pour traiter le texte octet par octet

Des chercheurs de la Ludwig-Maximilians-Universität München (LMU) ont développé une nouvelle méthode permettant de convertir des modèles linguistiques d'intelligence artificielle existants, tels que ceux qui alimentent ChatGPT, pour traiter le texte octet par octet. Ce processus de « byteification » nécessite une fraction du temps d'entraînement standard et améliore la capacité des modèles à gérer le texte à un niveau granulaire.

La plupart des modèles linguistiques actuels décomposent le texte en mots ou en fragments de mots avant de le traiter. Cette méthode, connue sous le nom de tokenisation de sous-mots, peut limiter la compréhension des modèles au niveau des lettres individuelles ou des caractères. La nouvelle technique permet aux modèles de fonctionner au niveau de l'octet, ce qui correspond approximativement au traitement de caractères uniques.

La recherche, publiée dans la revue Nature, a été menée en collaboration avec l'Allen Institute for AI, l'Université de Cambridge, l'Université de Washington et l'Imperial College London. Le processus de « byteification » conserve la majeure partie des performances du modèle d'origine tout en ajoutant les avantages du traitement au niveau de l'octet. Ces nouveaux modèles se sont avérés plus performants que les modèles précédents au niveau de l'octet de taille comparable.

Valentin Hofmann, professeur junior à la LMU et responsable de l'étude, pense que cette méthode peut résoudre des lacunes de longue date dans les modèles LLM. « Les modèles LLM conventionnels ont du mal avec les tâches qui nécessitent des capacités au niveau des caractères, comme épeler un mot à l'envers. Nos modèles « byteifiés » sont nettement meilleurs à cet égard », a déclaré Hofmann. Les modèles, le code et les données d'entraînement ont été rendus publiquement disponibles.

Source originale: lmu.de