LLM-työkalut luottavaisimpia virheellisten vastausten suhteen, arviointityökalu paljastaa
VentureBeatin mukaan tekoälymallit ovat luottavaisimpia virheellisten vastausten suhteen, kun niitä arvioidaan systemaattisesti. Perinteinen laadullinen arviointi ei havaitse tätä ongelmaa.

Uusi arviointimenetelmä paljastaa, että suuria kielimalleja (LLM) hyödyntävät yritystyökalut voivat olla merkittävän virheellisiä, vaikka ne esittäisivät vastauksensa erittäin vakuuttavasti.
Perinteinen laadullinen arviointi, jossa asiantuntijat tarkastavat mallin tuottamia vastauksia, on osoittautunut riittämättömäksi. Se havaitsee lähinnä ilmeiset virheet, huonon muotoilun tai aiheen vierestä menevät vastaukset. Se ei kuitenkaan kykene tunnistamaan tapauksia, joissa malli antaa auktoriteettisen ja uskottavan kuuloisen vastauksen, joka on kuitenkin todellisuudessa virheellinen ja vaatii ulkoista tarkistusta totuuden selvittämiseksi.
Tämä ero "kuulostaa oikealta" ja "on todennettavissa oikeaksi" -välillä on kriittinen, erityisesti kun LLM-avusteisia työkaluja käytetään päätöksenteossa, kuten datan laadun analysoinnissa, vaatimustenmukaisuuden tarkastuksessa tai operaatioiden hallinnassa. Tällaisissa sovelluksissa väärien vastausten seuraukset voivat olla merkittäviä.
VentureBeat kehitti arviointityökalun (eval harness), joka vertaa mallin tuottamia vastauksia merkittyyn todelliseen tietoon. Työkalu luo synteettistä dataa tunnetuilla syillä ja arvioi mallin vastauksia tarkkuuden ja sijoituksen perusteella. Tulokset osoittivat, että mallit olivat usein luottavaisimpia juuri silloin, kun niiden vastaukset olivat virheellisiä – erityisesti monimutkaisissa tilanteissa, joissa oli useita päällekkäisiä signaaleja. Tämä on ongelma, jota perinteinen laadullinen arviointi ei paljasta.
Kehitetty arviointityökalu voi auttaa tunnistamaan mallien heikkoudet ja parantamaan niiden luotettavuutta ennen niiden käyttöönottoa kriittisissä liiketoimintasovelluksissa.