📣 Skicka ert pressmeddelande till oss
Webbplatsen uppdateras var 15:e minut
Teknologi

Tencent detaljerar skalning av stort språkmodell

Tencents WeChat AI-team har presenterat en ny skalningsmetod för sin WeLM-modellfamilj, som möjliggör modeller med upp till 617 miljarder parametrar.

13 augusti 2026
Tencent detaljerar skalning av stort språkmodell

Tencents WeChat AI-team har beskrivit ett nytt tillvägagångssätt för att skala sin WeLM-modellfamilj. Teamet tränade modellerna WeLM-HD4-80B och WeLM-HD4-617B med en metod kallad Hidden Decoding, som expanderar varje token till flera interna beräkningsströmmar utan att öka Transformer-ryggraden.

80B-modellen aktiverar 3 miljarder parametrar, medan 617B-modellen aktiverar 23 miljarder. Båda modellerna överträffade sina matchade autoregressiva baslinjer över nio delade benchmarks i teamets tester.

De rapporterade träningskostnaderna var 5,1 gånger högre för 80B-modellen och 4,4 gånger högre för 617B-modellen jämfört med baslinjemodellerna.

Denna utveckling markerar ett steg mot mer effektiva och skalbara stora språkmodeller, vilket kan leda till mer kapabla AI-applikationer.

Ursprunglig källa: technode.com