Tencent stellt Skalierung von Sprachmodell auf 617 Milliarden Parameter vor
Tencents WeChat AI-Team hat einen neuen Skalierungsansatz für seine WeLM-Modellfamilie vorgestellt, der Modelle mit bis zu 617 Milliarden Parametern ermöglicht.

Tencents WeChat AI-Team hat eine neue Skalierungsmethode für seine WeLM-Modellfamilie detailliert beschrieben. Das Team trainierte die Modelle WeLM-HD4-80B und WeLM-HD4-617B mit einer Technik namens Hidden Decoding. Diese Methode erweitert jedes Token in mehrere interne Berechnungsströme, ohne die Kern-Transformer-Architektur zu verändern.
Das 80-Milliarden-Parameter-Modell aktiviert 3 Milliarden Parameter im Betrieb, während das 617-Milliarden-Parameter-Modell 23 Milliarden aktiviert. In internen Tests übertrafen beide Modelle ihre entsprechenden autoregressiven Basismodelle in neun gemeinsamen Benchmarks.
Die berichteten Schulungskosten betrugen das 5,1-fache der Basislinie für das 80B-Modell und das 4,4-fache der Basislinie für das 617B-Modell. Dieser Ansatz bietet eine Möglichkeit, die Modellleistung und Effizienz im großen Maßstab zu verbessern.
Die Entwicklung stellt einen bedeutenden Fortschritt im Management und Training extrem großer Sprachmodelle dar und ebnet möglicherweise den Weg für ausgefeiltere KI-Fähigkeiten.