Medizinische KI Erstellt Visuell Ansprechende Heatmaps, die Häufig Nicht mit Tatsächlichen Diagnosen Übereinstimmen

Image: Illustrative image · .edu.edits · CC BY-SA 4.0 · Source
Forscher des IIIT Hyderabad bewerteten vier KI-Modelle für Brustkorb-Röntgenbilder, die Heatmaps erzeugen, welche interessante Bereiche hervorheben. Sie stellten fest, dass diese Visualisierungen oft eher statistischen Mustern als tatsächlichen pathologischen Stellen entsprechen, was Bedenken hinsichtlich der klinischen Zuverlässigkeit aufwirft.
Ein Team des International Institute of Information Technology Hyderabad (IIIT Hyderabad) führte eine Überprüfung von vier spezialisierten Computer-Vision-Modellen durch, die für die Analyse von Brustkorb-Röntgenbildern entwickelt wurden. Die Studie konzentrierte sich darauf, wie gut die Aufmerksamkeit-Heatmaps—visuelle Überlagerungen, die Regionen markieren, die für die Diagnose der KI wichtig sind—mit tatsächlichen pathologischen Stellen übereinstimmen, die von Radiologen festgestellt wurden. Bewertet wurden die Modelle MAIRA-2, MedGemma-4B, LLaVA-Med-1.5 und LLaVA-1.5, getestet an drei öffentlichen Datensätzen sowie einer zusätzlichen Stichprobe von Pneumothorax-Patienten.
Ihr automatischer Vergleich bewertete MAIRA-2 am höchsten hinsichtlich der Übereinstimmung von Heatmap und Pathologie, gefolgt von MedGemma und anschließend den beiden LLaVA-Versionen. Ein entscheidender Befund war jedoch, dass die Modelle in typischen Fällen einfache anatomische Vorlagen basierend auf durchschnittlichen statistischen Verteilungen nicht übertrafen. Grundsätzlich neigte die KI dazu, Bereiche hervorzuheben, die statistisch mit bestimmten Pathologien assoziiert sind, anstatt die exakten Stellen, die in einzelnen Röntgenaufnahmen zu finden sind.
Nur in atypischen Fällen—in denen tatsächliche Befunde signifikant von üblichen Mustern abwichen—produzierten MAIRA-2 und MedGemma wirklich bildspezifische Lokalisationen und identifizierten die Pathologie genauer. Diese Einschränkung wirft Bedenken hinsichtlich der Zuverlässigkeit solcher KI-generierter Heatmaps als klinische Werkzeuge auf.
Weitere Experimente mit 124 Radiologen zeigten, dass Experten die Plausibilität der Heatmaps anders bewerten als automatische Metriken. Radiologen fanden oft breiter gefasste, klinisch bedeutsame Heatmaps überzeugender, auch wenn diese nicht exakt mit starren statistischen Grenzen übereinstimmten.
Die Forscher betonten insbesondere die Notwendigkeit, Bewertungsmetriken zu entwickeln, die anatomische Vorwissenseinbeziehen, und empfahlen, Radiologen eng in die Bewertung von KI-Werkzeugen einzubeziehen. Ihre Arbeit hebt eine wichtige Lücke zwischen visuellen Erklärungen von KI-Modellen und der praktischen klinischen Nutzbarkeit hervor und warnt vor einer Überabhängigkeit von visuell ansprechenden, aber potenziell irreführenden KI-Ergebnissen für medizinische Diagnosen.
Quellen und Originalberichte
Read the original source ↗

Kommentare (0)
Noch keine Kommentare.
Kommentar schreiben
Kommentare erscheinen nach Moderation. Name und Kommentar werden öffentlich angezeigt. Konto