Raaka suorituskyky ei kerro mallin todellista kustannusta
Uudet Qwen 3.8-Max ja Claude Opus 5 -mallit paljastavat, miksi raa'at vertailuarvot eivät ennusta todellisia käyttökustannuksia. Aika- ja tokenibudjetit vaikuttavat merkittävästi tuloksiin.

Tekoälymallien arvioinnissa raa'at suorituskykymittarit eivät välttämättä kerro koko totuutta käyttökustannuksista. Viimeaikaiset testit Alibaba'n Qwen 3.8-Maxista ja Anthropic'n Claude Opus 5:stä ovat osoittaneet, että mallien suorituskyky voi vaihdella suuresti riippuen aika- ja tokenibudjeteista, joita niille annetaan.
Alibaba julkaisi Qwen 3.8-Max-mallin ja väitti sen olevan lähes Claude Opus 5:n veroinen. Riippumattomat testit, jotka käyttivät erilaisia aika- ja tokenibudjetteja, antoivat kuitenkin ristiriitaisia tuloksia. Kun Qwen 3.8-Maxille annettiin huomattavasti pidempi aika ja suurempi tokenibudjetti, sen suorituskyky parani merkittävästi. Tämä korostaa, että mallin "paras yritys" voi olla jotain aivan muuta kuin sen oletusasetuksilla saavutettu tulos.
Asiantuntijat ehdottavat, että mallien arvioinnissa tulisi siirtyä pelkistä suorituskykymittareista kohti kustannus per onnistunut tehtävä -mallia. Tässä lasketaan kokonaiskustannukset, mukaan lukien epäonnistuneet yritykset, ja jaetaan ne onnistuneiden tehtävien määrällä. Samalla aika- ja tokenibudjetit tulisi määritellä selkeästi osana hyväksymiskriteereitä.
Perinteinen hinnoittelu, kuten hinta per token, ei enää riitä ennustamaan todellisia kustannuksia. Mallit, jotka käyttävät suuren osan tokenibudjetistaan ajatteluun, voivat saavuttaa tokenikaton ennen vastauksen tuottamista, mikä johtaa tyhjään tulokseen ja täyden suorituksen kustannukseen. Tämä on erityisen ongelmallista, kun mallien välistä vertailua tehdään perustuen vain julkaistuihin hintoihin.
Johtopäätöksenä voidaan todeta, että tekoälymallien todellisten kustannusten arvioinnissa on otettava huomioon aika- ja tokenibudjettien vaikutus. Kustannus per onnistunut tehtävä ja selkeät budjettikriteerit tarjoavat tarkemman kuvan mallin käytännöllisestä arvosta verrattuna pelkkiin suorituskykyvertailuihin.