📣 Skicka ert pressmeddelande till oss
Webbplatsen uppdateras var 15:e minut
Teknologi

Alibaba Qwen3.8-Max utmanar GPT-5.6 inom agentbaserad databehandling

Kinesiska teknikjätten Alibaba har lanserat sin nya stora språkmodell, Qwen3.8-Max. Modellen hävdar att den överträffar konkurrenter inom agentbaserad databehandling, inklusive OSWorld-benchmarks.

3 augusti 2026
Alibaba Qwen3.8-Max utmanar GPT-5.6 inom agentbaserad databehandling

Alibabas AI-forskningsgrupp har presenterat sin nya flaggskeppsmodell, Qwen3.8-Max. Det är en multimodal stor språkmodell (LLM) med 2,4 biljoner parametrar, fokuserad på autonom programvaruutveckling och långsiktiga företagsuppgifter.

Enligt företagets publicerade benchmarkresultat överträffar Qwen3.8-Max flera nuvarande konkurrerande modeller inom viktiga områden av agentbaserad databehandling. Specifikt i OSWorld-benchmarken uppnådde Qwen3.8-Max 86,1 poäng, mer än GPT-5.6 Sol Max (83,2) och Fable 5 (85,0). Modellen fick också högst poäng i PaperBench och visade stark konkurrenskraft inom programvaruutveckling, reproducerbarhet av forskning och multimodal resonemang.

Lanseringen kan signalera en strategisk förändring för Alibaba, då företaget planerar att släppa öppna vikter för Qwen3.8-Max och Qwen3.8-27B nästa vecka. Om modellerna släpps under en tillåtande licens, skulle det möjliggöra egen drift i företagsmiljöer, vilket kan påverka deras adoption avsevärt.

De exakta licensvillkoren har ännu inte avslöjats, vilket lämnar möjligheten öppen för en mer restriktiv anpassad licens, liknande den kinesiska konkurrenten Moonshot AI:s Kimi K3-modell. Detta kan begränsa modellens breda användning.

Modellen syftar till att kombinera flera styrkor för företagsautomation. Alibaba beskriver modellen som en autonom kollega kapabel att utföra projekt som sträcker sig över flera dagar. Den påstås kunna självständigt slutföra programvaruutvecklingsprojekt på över tio dagar, reproducera forskningsartiklar med tusentals kodrader och använda multimodal feedback för kontinuerlig planjustering. Dessa demonstrationer är producerade av företaget och har ännu inte verifierats brett av oberoende utvärderare, men de återspeglar en branschtrend mot modeller som slutför hela arbetsflöden snarare än enskilda uppmaningar.

Ursprunglig källa: venturebeat.com