Alibaba Clouds Recheninstanzen unterstützen Kimi K3 Sprachmodell
Alibaba Cloud gab bekannt, dass seine Lingjun Zhenwu M890 Superknoten-Instanzen nun das Kimi K3 Large Language Model mit 2,8 Billionen Parametern unterstützen. Diese gemeinsame Optimierung verbessert die Effizienz der Modellinferenz.

IT Home, 28. Juli -- Alibaba Cloud gab heute bekannt, dass seine Lingjun Zhenwu M890 Superknoten-Instanzen erfolgreich für das Kimi K3 Large Language Model mit 2,8 Billionen Parametern angepasst wurden. Diese Integration, die durch gemeinsame Optimierung von Chips, Inferenzplattformen und dem Modell selbst erreicht wurde, verbessert die Inferenzleistung des Modells erheblich.
Das Kimi K3-Modell ist das neueste Flaggschiffangebot von Moonshot AI, das sich durch seine beträchtliche Anzahl von 2,8 Billionen Parametern und seine Mixture-of-Experts (MoE)-Architektur auszeichnet. Die Lingjun Zhenwu Superknoten-Instanzen basieren auf dem Zhenwu M890 Chip von Pingtouge AI, der für Training und Inferenz entwickelt wurde, und umfassen den ICN Switch 1.0 Interconnect-Chip.
Diese Hardwarekonfiguration ermöglicht es 64 M890-Chips, eine Hochgeschwindigkeits-All-to-All-Verbindung von 800 GB/s mit einer Gesamtspeicher Kapazität von 9 TB zu erreichen. Diese Infrastruktur ist darauf ausgelegt, die Kommunikationsanforderungen von Billionen-Parameter MoE-Modellen zu bewältigen und eine effiziente Token-Generierung zu gewährleisten.
Alibaba Cloud, Pingtouge und das Kimi-Team arbeiteten über Software-Stacks und andere Ebenen hinweg eng zusammen, um die "Day0"-Kompatibilität für das Kimi K3-Modell zu erreichen. Der T-Head SAIL Software-Stack des Zhenwu-Chips ermöglicht den direkten Betrieb des von Kimi entwickelten Mooncake-Inferenz-Frameworks. Die Triton-Unterstützung des M890 erlaubt die Ausführung von benutzerdefinierten Operatoren, die in Triton geschrieben sind, ohne Modifikation, was den Anpassungsaufwand erheblich reduziert.