Baidu lanserar DuMateBench-benchmark för utvärdering av AI-agenter
Baidu har lanserat DuMateBench, en utvärderingsplattform som mäter AI-agenters förmåga att slutföra verkliga uppgifter och leverera användbara resultat, inte bara generera svar.

Det kinesiska teknikföretaget Baidu har lanserat DuMateBench, en ny utvärderingsplattform som är utformad för att mäta huruvida AI-agenter kan slutföra verkliga uppgifter och leverera användbara resultat, snarare än att enbart generera svar. Denna nya benchmark fokuserar på agenternas praktiska förmåga i komplexa miljöer.
DuMateBench inkluderar över 200 kontorsrelaterade uppgifter indelade i sex kategorier. Plattformen testar agenternas prestanda i termer av uppgiftsförståelse, användning av verktyg, kontinuerlig exekvering och leverans av slutresultat. Baidu betonar att detta skiftar fokus från AI-modellens förmåga att svara till dess förmåga att faktiskt slutföra och leverera.
Plattformen använder ett generellt ramverk för utvärdering och öppna gränssnitt, vilket möjliggör testning av olika modeller och agenter under samma kriterier. Detta syftar till att erbjuda en standardiserad metod för att bedöma AI-agenternas praktiska tillämpbarhet och effektivitet i affärssammanhang.