LLM-verktyg mest självsäkra när de har fel, avslöjar utvärderingsverktyg
Enligt VentureBeat är AI-modeller som mest självsäkra när de ger felaktiga svar, enligt systematiska utvärderingar. Traditionell kvalitativ granskning misslyckas med att upptäcka detta problem.

En ny utvärderingsmetod har avslöjat att företagsverktyg som använder stora språkmodeller (LLM) kan vara avsevärt felaktiga, även när de presenterar sina svar på ett mycket övertygande sätt.
Traditionell kvalitativ granskning, där experter kontrollerar modellens svar, har visat sig vara otillräcklig. Den identifierar främst uppenbara fel, dålig formatering eller svar som avviker från ämnet. Den kan dock inte upptäcka fall där modellen ger ett auktoritativt och trovärdigt svar som i verkligheten är felaktigt och kräver extern verifiering för att fastställa sanningen.
Denna skillnad mellan "låter rätt" och "är verifierbart korrekt" är kritisk, särskilt när LLM-assisterade verktyg används för beslutsfattande inom områden som dataanalys, regelefterlevnadskontroller eller driftshantering. I sådana applikationer kan konsekvenserna av felaktiga svar vara betydande.
VentureBeat utvecklade ett utvärderingsverktyg (eval harness) som jämför modellens svar med märkt, faktisk data. Verktyget genererar syntetisk data med kända orsaker och utvärderar modellens svar baserat på noggrannhet och rangordning. Resultaten visade att modellerna ofta var som mest självsäkra just när deras svar var felaktiga – särskilt i komplexa scenarier med flera överlappande signaler. Detta är ett problem som traditionell kvalitativ granskning inte avslöjar.
Det utvecklade utvärderingsverktyget kan hjälpa till att identifiera modellernas svagheter och förbättra deras tillförlitlighet innan de tas i bruk i kritiska affärsapplikationer.