Alibaba publie les poids du grand modèle linguistique Qwen3.8-2.4T-A95B
Alibaba a rendu publics les poids de son modèle linguistique Qwen3.8-2.4T-A95B. Le modèle prend en charge nativement 262 144 tokens de contexte, extensible à plus d'un million.

Alibaba a annoncé la publication ouverte des poids de son grand modèle linguistique Qwen3.8-2.4T-A95B via sa communauté ModelScope. C'est la première fois que les poids d'un modèle de niveau Qwen-Max sont rendus accessibles au public.
Le modèle dispose d'un total de 2,4 billions de paramètres, activant 95 milliards de paramètres par token. Notamment, il prend en charge nativement une fenêtre de contexte de 262 144 tokens, extensible à plus d'un million de tokens. Cette capacité de contexte significative permet le traitement et la compréhension de textes et de dialogues beaucoup plus longs.
Qwen3.8 est spécifiquement conçu pour améliorer les performances en programmation, tâches de bureau, recherche scientifique et tâches d'Agent de longue durée. La version cloud d'Alibaba, Qwen3.8-Max, est basée sur ces poids publiés et intègre des capacités supplémentaires pour les environnements de production.
Les évaluations initiales suggèrent que le modèle est compétitif par rapport à d'autres grands modèles linguistiques de premier plan, notamment GPT-4 et Opus. Il a démontré de solides performances dans divers benchmarks, y compris ceux pour les tâches d'Agent de programmation, les capacités générales d'Agent, le travail professionnel et la compréhension de contexte long. L'architecture du modèle utilise la technologie Mixture-of-Experts (MoE), avec 512 experts par couche et 10 experts activés par token.