Medicinsk AI Skapar Visuellt Tilltalande Värmekartor som Ofta Inte Stämmer Överens med Faktiska Diagnoser

Bild: Illustrative image · .edu.edits · CC BY-SA 4.0 · Källa
Forskare vid IIIT Hyderabad utvärderade fyra AI-modeller för bröstkorgsröntgen som genererar värmekartor för att framhäva intressanta områden. De fann att dessa visualiseringar ofta korrelerar mer med statistiska mönster än med sanna patologiska platser, vilket väcker oro kring klinisk tillförlitlighet.
Ett team från International Institute of Information Technology Hyderabad (IIIT Hyderabad) genomförde en granskning av fyra specialiserade datorvisionsmodeller som är designade för analys av bröstkorgsröntgenbilder. Studien fokuserade på hur väl uppmärksamhetsvärmekartorna—visuella överlägg som visar områden viktiga för AI:ns diagnos—överensstämde med verkliga patologiska platser noterade av radiologer. De utvärderade modellerna var MAIRA-2, MedGemma-4B, LLaVA-Med-1.5 och LLaVA-1.5, testade över tre offentliga datamängder och ett extra prov av patienter med pneumothorax.
Deras automatiska jämförelse rankade MAIRA-2 högst i överensstämmelse mellan värmekarta och patologi, följt av MedGemma och därefter de två LLaVA-versionerna. En kritisk fynd var dock att modellerna i typiska fall inte överträffade enkla anatomiska mallar baserade på genomsnittliga statistiska fördelningar. I praktiken tenderade AI:n att framhäva områden som statistiskt associerades med vissa patologier snarare än de exakta platserna som hittades i individuella röntgenbilder.
Endast i atypiska fall—där faktiska fynd avvek betydligt från vanliga mönster—producerade MAIRA-2 och MedGemma verkligen bildspecifik lokalisering och identifierade patologin mer exakt. Denna begränsning väcker oro kring tillförlitligheten hos sådana AI-genererade värmekartor som kliniska verktyg.
Ytterligare experiment med 124 radiologer visade att experter tolkar värmekartornas trovärdighet annorlunda än automatiska mätvärden. Radiologer fann ofta bredare, kliniskt meningsfulla värmekartor mer övertygande, även om dessa inte exakt motsvarade strikta statistiska gränser.
Forskarna betonade särskilt behovet av att utveckla utvärderingsmått som inkluderar anatomiska förkunskaper och rekommenderade nära involvering av radiologer vid bedömning av AI-verktyg. Deras arbete belyser en viktig klyfta mellan AI-modellers visuella förklaringar och verklig klinisk användbarhet, och varnar för alltför stort beroende av visuellt tilltalande men potentiellt vilseledande AI-resultat för medicinsk diagnostik.
Källor och ursprunglig rapportering
Läs den ursprungliga källan ↗

Kommentarer (0)
Inga kommentarer ännu. Börja diskussionen.
Skriv en kommentar
Kommentarer publiceras efter granskning. Ditt namn och kommentar syns offentligt. Konto