Alibaba veröffentlicht Gewichte für großes Sprachmodell Qwen3.8-2.4T-A95B
Alibaba hat die Gewichte seines Sprachmodells Qwen3.8-2.4T-A95B offen zugänglich gemacht. Das Modell unterstützt nativ 262.144 Tokens Kontext und kann auf über eine Million erweitert werden.

Das chinesische Technologieunternehmen Alibaba hat die Gewichte seines KI-Modells Qwen3.8-2.4T-A95B über seine ModelScope-Community offen veröffentlicht. Dies ist das erste Mal, dass die Gewichte eines Modells der Qwen-Max-Klasse öffentlich verfügbar gemacht werden.
Das Modell verfügt über insgesamt 2,4 Billionen Parameter, wobei 95 Milliarden Parameter pro Token aktiviert werden. Bemerkenswert ist die native Unterstützung eines Kontextfensters von 262.144 Tokens, das auf über eine Million Tokens erweitert werden kann. Diese erhebliche Kapazität ermöglicht die Verarbeitung und das Verständnis wesentlich längerer Texte und Dialoge.
Qwen3.8 wurde speziell entwickelt, um die Leistung bei Programmieraufgaben, Büroarbeiten, wissenschaftlicher Forschung und langlaufenden Agentenaufgaben zu verbessern. Alibabas Cloud-Version, Qwen3.8-Max, basiert auf diesem offenen Gewichtsmodell und enthält zusätzliche Funktionen für Produktionsumgebungen.
Erste Bewertungen deuten darauf hin, dass das Modell im Vergleich zu anderen führenden großen Sprachmodellen wie GPT-4 und Opus wettbewerbsfähig ist. Es zeigte starke Leistungen in verschiedenen Benchmarks, einschließlich solcher für Programmier-Agentenaufgaben, allgemeine Agentenfähigkeiten, professionelle Arbeit und das Verständnis langer Kontexte. Die Architektur des Modells nutzt die Mixture-of-Experts (MoE)-Technologie mit 512 Experten pro Schicht und 10 aktivierten Experten pro Token.