📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

Le Qwen3.8-Max d'Alibaba défie GPT-5.6 dans le calcul agentiel

Le géant technologique chinois Alibaba a dévoilé son nouveau modèle phare de grand langage, Qwen3.8-Max. Le modèle prétend surpasser ses concurrents dans les tâches de calcul agentiel, y compris les benchmarks OSWorld.

3 août 2026
Le Qwen3.8-Max d'Alibaba défie GPT-5.6 dans le calcul agentiel

L'équipe de recherche en IA d'Alibaba a présenté son nouveau modèle phare, Qwen3.8-Max. Ce grand modèle de langage multimodal (LLM) de 2,4 billions de paramètres cible l'ingénierie logicielle autonome et les tâches d'entreprise à long terme.

Selon les résultats de référence publiés par l'entreprise, Qwen3.8-Max surpasse plusieurs modèles concurrents dans des domaines clés du calcul agentiel. Notamment, dans le benchmark OSWorld, Qwen3.8-Max a obtenu un score de 86,1, dépassant GPT-5.6 Sol Max (83,2) et Fable 5 (85,0). Le modèle a également obtenu les meilleurs scores sur PaperBench et a démontré une forte compétitivité dans les domaines du développement logiciel, de la reproductibilité de la recherche et du raisonnement multimodal.

La sortie pourrait signaler un changement stratégique pour Alibaba, car l'entreprise prévoit de publier les poids ouverts pour Qwen3.8-Max et Qwen3.8-27B la semaine prochaine. S'ils sont publiés sous une licence permissive, cela permettrait l'auto-hébergement dans les environnements d'entreprise, impactant potentiellement de manière significative leur adoption.

Les termes de licence exacts n'ont pas encore été divulgués, laissant ouverte la possibilité d'une licence personnalisée plus restrictive, similaire à celle du modèle Kimi K3 de la société chinoise rivale Moonshot AI. Cela pourrait limiter l'utilisation généralisée du modèle.

Le modèle vise à combiner plusieurs forces pour l'automatisation d'entreprise. Alibaba le décrit comme un collaborateur autonome capable d'exécuter des projets de plusieurs jours. Il est revendiqué comme capable de terminer de manière indépendante des projets de développement logiciel de plus de dix jours, de reproduire des articles de recherche avec des milliers de lignes de code et d'utiliser le retour multimodal pour l'ajustement continu des plans. Ces démonstrations sont produites par l'entreprise et n'ont pas encore été largement vérifiées par des évaluateurs indépendants, mais elles reflètent une tendance de l'industrie vers des modèles qui complètent des flux de travail entiers plutôt que des invites individuelles.

Source originale: venturebeat.com