Медицинский ИИ создаёт визуально привлекательные тепловые карты, которые часто не совпадают с фактическими диагнозами

Image: Illustrative image · .edu.edits · CC BY-SA 4.0 · Source
Исследователи из IIIT Hyderabad оценили четыре модели искусственного интеллекта для анализа рентгеновских снимков грудной клетки, генерирующие тепловые карты, выделяющие области интереса. Они обнаружили, что эти визуализации чаще соответствуют статистическим паттернам, а не реальным патологическим участкам, что вызывает опасения по поводу клинической надёжности.
Команда из Международного института информационных технологий Хайдарабада (IIIT Hyderabad) провела аудит четырёх специализированных моделей компьютерного зрения, предназначенных для анализа рентгеновских снимков грудной клетки. Исследование было сосредоточено на том, насколько хорошо тепловые карты внимания — визуальные наложения, указывающие области, важные для диагноза ИИ — соответствовали реальным патологическим локациям, отмеченным радиологами. Оценивались модели MAIRA-2, MedGemma-4B, LLaVA-Med-1.5 и LLaVA-1.5, протестированные на трёх публичных наборах данных и дополнительной выборке пациентов с пневмотораксом.
Автоматическое сравнение показало, что MAIRA-2 занимает первое место по совпадению тепловых карт с патологией, за ним следует MedGemma, а затем две версии LLaVA. Однако ключевым выводом стало то, что в типичных случаях модели не превосходили простые анатомические шаблоны, основанные на средних статистических распределениях. Фактически ИИ склонен выделять области, статистически связанные с определёнными патологиями, а не точные локализации на индивидуальных рентгеновских снимках.
Только в атипичных случаях — когда реальные находки существенно отличались от распространённых паттернов — MAIRA-2 и MedGemma смогли создавать действительно специфичную локализацию по изображению, точнее указывая на патологию. Это ограничение вызывает вопросы о надёжности таких тепловых карт, созданных ИИ, в клиническом использовании.
Дальнейшие эксперименты с участием 124 радиологов показали, что эксперты воспринимают правдоподобность тепловых карт иначе, чем автоматические метрики. Радиологи часто находили более широкие, клинически значимые тепловые карты более убедительными, даже если они не точно совпадали со строгими статистическими границами.
Исследователи особо подчеркнули необходимость разработки методов оценки с учётом анатомических данных и рекомендовали тесно привлекать радиологов к оценке ИИ-инструментов. Их работа подчёркивает важный разрыв между визуальными объяснениями моделей ИИ и реальной клинической полезностью, предостерегая от чрезмерного доверия к визуально привлекательным, но потенциально вводящим в заблуждение результатам ИИ в медицинской диагностике.
Источники и первоисточники
Read the original source ↗

Комментарии (0)
Комментариев пока нет. Начните обсуждение.
Написать комментарий
Комментарии публикуются после модерации. Ваше имя и комментарий будут видны всем. Аккаунт