Les instances de calcul Alibaba Cloud prennent en charge le modèle Kimi K3
Alibaba Cloud a annoncé que ses instances supernœuds Lingjun Zhenwu M890 prennent désormais en charge le modèle de grands langages Kimi K3 avec 2,8 billions de paramètres. Cette optimisation conjointe améliore l'efficacité de l'inférence du modèle.

IT Home, 28 juillet -- Alibaba Cloud a annoncé aujourd'hui que ses instances supernœuds Lingjun Zhenwu M890 ont été adaptées avec succès pour le modèle de grands langages Kimi K3, qui compte 2,8 billions de paramètres. Cette intégration, réalisée grâce à une optimisation conjointe des puces, des plateformes d'inférence et du modèle lui-même, améliore considérablement l'efficacité de l'inférence du modèle.
Le modèle Kimi K3 est la dernière offre phare de Moonshot AI, caractérisé par son nombre substantiel de 2,8 billions de paramètres et son architecture Mixture-of-Experts (MoE). Les instances supernœuds Lingjun Zhenwu sont construites sur la puce Zhenwu M890 de Pingtouge AI, conçue pour l'entraînement et l'inférence, et intègrent la puce d'interconnexion ICN Switch 1.0.
Cette configuration matérielle permet à 64 puces M890 d'atteindre une interconnexion All-to-All à haute vitesse de 800 Go/s, avec une capacité mémoire totale de 9 To. Cette infrastructure est conçue pour gérer les exigences de communication des modèles MoE à trillions de paramètres, garantissant une génération de tokens efficace.
Alibaba Cloud, Pingtouge et l'équipe Kimi ont collaboré étroitement à travers les piles logicielles et d'autres couches pour atteindre la compatibilité « Day0 » pour le modèle Kimi K3. La pile logicielle T-Head SAIL de la puce Zhenwu permet au framework d'inférence Mooncake personnalisé par Kimi de fonctionner directement, et la prise en charge Triton du M890 permet aux opérateurs personnalisés écrits en Triton de s'exécuter sans modification, réduisant considérablement les charges de travail d'adaptation.