Tencent detaljerar skalning av stort språkmodell
Tencents WeChat AI-team har presenterat en ny skalningsmetod för sin WeLM-modellfamilj, som möjliggör modeller med upp till 617 miljarder parametrar.

Tencents WeChat AI-team har beskrivit ett nytt tillvägagångssätt för att skala sin WeLM-modellfamilj. Teamet tränade modellerna WeLM-HD4-80B och WeLM-HD4-617B med en metod kallad Hidden Decoding, som expanderar varje token till flera interna beräkningsströmmar utan att öka Transformer-ryggraden.
80B-modellen aktiverar 3 miljarder parametrar, medan 617B-modellen aktiverar 23 miljarder. Båda modellerna överträffade sina matchade autoregressiva baslinjer över nio delade benchmarks i teamets tester.
De rapporterade träningskostnaderna var 5,1 gånger högre för 80B-modellen och 4,4 gånger högre för 617B-modellen jämfört med baslinjemodellerna.
Denna utveckling markerar ett steg mot mer effektiva och skalbara stora språkmodeller, vilket kan leda till mer kapabla AI-applikationer.