
Современный искусственный интеллект для анализа медицинских изображений способен не только выявлять возможные заболевания по магнитно-резонансной томографии (МРТ) головного мозга, но и показывать, какие именно участки мозга повлияли на его вывод. Благодаря тому, что система представляет не только результат, но и его обоснование, её заключения кажутся более убедительными.
Однако устойчивость такого «обоснования», выделенного ИИ, нужно проверять отдельно. Если при повторном обучении ИИ той же архитектуры он указывает на совершенно другие участки мозга, значит, первоначальное объяснение могло оказаться случайным результатом конкретного цикла обучения.
Исследовательская группа профессора Кристиана Валравена с факультета искусственного интеллекта Университета Корё совместно с группой профессоров Ю Сонхе, Ким Богю и Пак Арим из отделения радиологии больницы Университета Корё в Анъаме 24-го июля сообщила, что сравнила несколько показателей для оценки объяснений медицинского ИИ. По итогам работы «робастность (Robustness)» — показатель того, насколько последовательно сохраняется объяснение при повторном обучении, — лучше всего совпала с клиническими основаниями.
Правдоподобное объяснение и объяснение, которому можно доверять, — не одно и то же
ИИ на основе глубокого обучения выдаёт результат, проходя через множество вычислительных этапов. Человеку практически невозможно проследить и понять этот процесс шаг за шагом. Поэтому даже если ИИ указывает на патологические признаки, медицинскому персоналу трудно чётко понять, почему он пришёл к такому выводу. Из-за этой «непрозрачности» проблему называют «проблемой чёрного ящика».
Технология, призванная компенсировать этот недостаток, — объяснимый искусственный интеллект (XAI). Он отображает области мозга, которые ИИ счёл важными, в виде карты и помогает врачам визуально проверить основания решения.
Проблема в том, что до сих пор нет общепринятого стандарта, позволяющего отделить объяснения, которым можно доверять, от тех, что лишь выглядят убедительно. Предлагались критерии, оценивающие, насколько объяснение точно отражает реальный процесс принятия решения ИИ и насколько оно простое и понятное, однако достаточно ли они проверены с точки зрения того, указывают ли на клинически значимые области, оставалось неясным.

Робастность, на которую обратила внимание команда, — это показатель того, насколько похожими остаются области, отмеченные ИИ как важные, если ИИ одной и той же архитектуры обучать многократно, меняя лишь стартовую точку обучения. Чем выше балл, тем больше это означает, что объяснение не является случайным результатом одного цикла обучения, а представляет собой стабильное объяснение, которое воспроизводится и при повторном обучении.
Команда использовала около 40 тыс. МРТ головного мозга из UK Biobank и инициативы Alzheimer’s Disease Neuroimaging Initiative (ADNI). Скомбинировав 9 различных моделей глубокого обучения и 8 методов объяснения, исследователи провели более 10 тыс. симуляций.
Затем каждый показатель оценки сопоставили с тремя критериями клинической значимости. Разделив МРТ на небольшие ячейки — «воксели», — исследователи проанализировали различия в форме мозговых тканей и отдельно сравнили: связь между заболеванием и объёмом по областям мозга, а также оценки врачей-рентгенологов.
Достаточно ли просто высокой точности
Анализ показал, что существующие показатели — такие как «верность» (насколько хорошо отражён процесс принятия решения ИИ) или «сложность» (насколько объяснение простое) — слабо коррелировали с клиническими основаниями. Даже при одном и том же методе объяснения баллы могли сильно меняться, если менялась архитектура модели ИИ.
В то же время робастность относительно последовательно совпадала с выводами анализа формы мозга и объёмов по областям, а также с оценками врачей-рентгенологов. Результаты оценки не сильно колебались даже при изменении архитектуры модели ИИ, а вычислительная эффективность была удовлетворительной.
Профессор Валравен заявил: «Значимость этого исследования в том, что оно системно связало критерии оценки того, насколько можно доверять объяснениям медицинского ИИ, с клиническими основаниями».
Профессор Ю Сонхе отметила: «Чтобы медицинский ИИ применялся в реальной клинической практике, необходимо подтверждать не только высокие диагностические показатели, но и то, что основания решения, предложенные ИИ, клинически обоснованны и последовательны».
Вместе с тем исследование было сосредоточено на структурной МРТ головного мозга и двух аналитических задачах. Требуется дополнительная проверка того, демонстрирует ли робастность такой же уровень валидности и для других видов медицинских изображений — компьютерной томографии (CT), рентгеновских снимков, патоморфологических изображений и т. д.
Закон Европейского союза об искусственном интеллекте относит часть ИИ, используемого в медицинских устройствах и т. п., к системам высокого риска и требует прозрачности, точности, робастности и других характеристик. Это исследование показывает, что при оценке медицинского ИИ важно учитывать не только диагностическую точность, но и то, сохраняется ли предлагаемое ИИ объяснение последовательно при повторном обучении.
Результаты исследования опубликованы в онлайн-версии международного научного журнала 《Medical Image Analysis》 16 июня.
