KI-förklaringar förbättrar diagnostisk noggrannhet inom radiologi
Forskning vid Ludwig-Maximilians-Universität München (LMU) visar att AI-modeller som ChatGPT kan öka precisionen i radiologiska diagnoser, förutsatt att deras förklaringar är transparenta och följer ett steg-för-steg-format.

En studie från Ludwig-Maximilians-Universität München (LMU) har visat att artificiell intelligens (AI) kan förbättra diagnostisk noggrannhet inom radiologi, men att dess effektivitet är beroende av hur AI:n rekommendationer förklaras.
Stora språkmodeller, såsom ChatGPT, diskuteras alltmer som ett stöd inom medicinen. De kan sammanfatta information, föreslå diagnoser och förklara sina bedömningar på ett begripligt sätt. Studiens centrala insikt är att kvaliteten på AI:ns förklaringar är avgörande för dess praktiska nytta.
Ett forskarteam från LMU, LMU Klinikum, Karlsruher Institut für Technologie och Universität Bayreuth genomförde ett randomiserat experiment med 101 radiologer. Deltagarna bedömde verkliga kliniska fall med radiologiska bilder och skulle formulera en diagnos. I experimentet jämfördes en kontrollgrupp utan AI med tre grupper som fick olika typer av stöd från en multimodal språkmodell: endast en diagnos, en differentialdiagnos eller en stegvis "chain-of-thought"-förklaring. Den senare beskrev bildkaraktäristik, kliniska ledtrådar och exklusionskriterier på ett transparent sätt.
Studien visade att radiologer uppnådde högst diagnostisk noggrannhet när de använde de stegvisa AI-förklaringarna. Träffsäkerheten var 12,2 procentenheter högre jämfört med kontrollgruppen. Enkla diagnosutlåtanden och differentialdiagnoser gav sämre resultat. I fall där AI:n förslag var felaktiga, tenderade deltagarna att oftare följa differentialdiagnoserna, vilket indikerar en risk för automationsbias. De stegvisa förklaringarna hjälpte däremot till att identifiera korrekta ledtrådar och att upptäcka fel.
Resultaten antyder att det inte bara är diagnosens kvalitet som är viktig, utan även hur förklaringen utformas för att stödja radiologers kritiska bedömning. De stegvisa förklaringarna gör modellens resonemang synligt och underlättar jämförelsen med egen expertis. Enligt professor Stefan Feuerriegel, en av studiens korresponderande författare, är dessa slutsatser relevanta även utanför medicinens område, då de belyser vikten av att användare aktivt granskar och förstår AI-genererade svar, inte bara accepterar dem.