Tencent détaille la mise à l'échelle d'un grand modèle de langage à 617 milliards de paramètres
L'équipe IA de WeChat chez Tencent a présenté une nouvelle approche de mise à l'échelle pour sa famille de modèles WeLM, permettant des modèles allant jusqu'à 617 milliards de paramètres.

L'équipe IA de WeChat chez Tencent a détaillé une nouvelle méthode de mise à l'échelle pour sa famille de modèles WeLM. L'équipe a entraîné les modèles WeLM-HD4-80B et WeLM-HD4-617B en utilisant une technique appelée Hidden Decoding. Cette méthode étend chaque token en plusieurs flux de calcul internes sans modifier l'architecture Transformer principale.
Le modèle de 80 milliards de paramètres active 3 milliards de paramètres en fonctionnement, tandis que le modèle de 617 milliards de paramètres en active 23 milliards. Lors de tests internes, les deux modèles ont surpassé leurs modèles de base autorégressifs correspondants sur neuf benchmarks partagés.
Les coûts d'entraînement rapportés étaient 5,1 fois supérieurs à la base pour le modèle 80B et 4,4 fois supérieurs à la base pour le modèle 617B. Cette approche offre un moyen d'améliorer les performances et l'efficacité des modèles à grande échelle.
Cette avancée représente un progrès significatif dans la gestion et l'entraînement de modèles de langage extrêmement volumineux, ouvrant potentiellement la voie à des capacités d'IA plus sophistiquées.