Medyczna sztuczna inteligencja generuje atrakcyjne wizualnie mapy cieplne, które często nie pokrywają się z rzeczywistymi diagnozami

Image: Illustrative image · .edu.edits · CC BY-SA 4.0 · Source
Naukowcy z IIIT Hyderabad ocenili cztery modele AI do analizy zdjęć rentgenowskich klatki piersiowej, które tworzą mapy cieplne uwidaczniające obszary zainteresowania. Stwierdzili, że te wizualizacje częściej odpowiadają wzorcom statystycznym niż faktycznym lokalizacjom patologii, co budzi obawy o wiarygodność kliniczną.
Zespół z International Institute of Information Technology w Hyderabad (IIIT Hyderabad) przeprowadził audyt czterech wyspecjalizowanych modeli wizji komputerowej przeznaczonych do analizy zdjęć rentgenowskich klatki piersiowej. Badanie skupiło się na tym, jak dobrze mapy cieplne uwagi — wizualne nakładki wskazujące regiony istotne dla diagnozy AI — pokrywały się z rzeczywistymi lokalizacjami patologii zaznaczonymi przez radiologów. Oceniane modele to MAIRA-2, MedGemma-4B, LLaVA-Med-1.5 oraz LLaVA-1.5, testowane na trzech publicznych zbiorach danych oraz dodatkowej próbie pacjentów z pneumothorax.
Automatyczne porównanie klasyfikowało MAIRA-2 jako model najlepiej dopasowujący mapy cieplne do lokalizacji patologii, następnie MedGemma, a potem dwie wersje LLaVA. Jednak kluczowym wynikiem było to, że w typowych przypadkach modele nie przewyższały prostych szablonów anatomicznych opartych na przeciętnych rozkładach statystycznych. W praktyce AI miała tendencję do podświetlania obszarów statystycznie powiązanych z danymi patologiami, zamiast dokładnie wskazywać miejsca faktycznie występujące na indywidualnych zdjęciach rentgenowskich.
Tylko w nietypowych przypadkach — gdy rzeczywiste zmiany znacząco odbiegały od powszechnych wzorców — MAIRA-2 i MedGemma faktycznie tworzyły lokalizacje specyficzne dla obrazu, precyzyjniej wskazując lokalizację patologii. To ograniczenie wzbudza obawy dotyczące wiarygodności takich map cieplnych generowanych przez AI jako narzędzi klinicznych.
Kolejne eksperymenty z udziałem 124 radiologów wykazały, że eksperci interpretują wiarygodność map cieplnych inaczej niż automatyczne metryki. Radiolodzy często uznawali szersze, klinicznie znaczące mapy za bardziej przekonujące, nawet jeśli nie odpowiadały one ściśle statystycznym granicom.
Badacze szczególnie podkreślili potrzebę opracowania metryk oceny uwzględniających informacje anatomiczne i zalecili ścisłą współpracę z radiologami przy ocenie narzędzi AI. Ich praca uwidacznia istotną lukę pomiędzy wizualnymi wyjaśnieniami modeli AI a rzeczywistą użytecznością kliniczną, przestrzegając przed nadmiernym poleganiem na atrakcyjnych wizualnie, lecz potencjalnie mylących wynikach AI w diagnostyce medycznej.
Źródła i oryginalne doniesienia
Read the original source ↗

Komentarze (0)
Nie ma jeszcze komentarzy.
Napisz komentarz
Komentarze publikujemy po moderacji. Nazwa i komentarz będą publiczne. Konto