Препринт — материал ещё не прошёл рецензирование
Объяснения верно находят сердце, но путают нужные кадры
Кратко
Авторы проверили две модели, которые оценивают фракцию выброса по эхокардиографии, то есть по видео сердца. Оба подхода хорошо попадали в область сердца на изображении, но почти не умели указывать на нужные моменты цикла: по времени их ответы были на уровне случайности. Дополнительная проверка с перекрытием кадров показала, что проблема связана не только с методом объяснения, но и с тем, как сама модель принимает решение.
Зачем это знать
Такие проверки полезны, когда модель хотят использовать для медицинских видео: красивое объяснение ещё не значит, что модель опирается на правильные моменты. Здесь это предупреждение для разработчиков и врачей, которые оценивают не только точность прогноза, но и то, на чём он основан.
Разбор
Авторы взяли два разных видеомоделя для эхокардиографии — один на основе трансформера, другой на основе сверточной сети — и дообучили их на задачу оценки фракции выброса. Потом они проверили не только точность прогноза, но и то, можно ли верить объяснениям, которые показывают, на какие части видео модель опирается. Для этого они сравнили, попадает ли важность в область левого желудочка, и отдельно посмотрели, умеет ли объяснение указывать на те самые ключевые кадры, где сердце максимально сжато и максимально наполнено кровью.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что статью ещё не проверяли внешние рецензенты. С другой стороны, авторы тестировали сразу две разные архитектуры и проверяли их на наборе EchoNet-Dynamic с 50 случаями в расчётах доверительных интервалов — это уже не выглядит как случайный пример. Но выборка для детального аудита всё же не очень большая, поэтому выводы сильнее всего подходят как предупреждение и как направление для дальнейшей проверки.
Пересказано ИИ по научной статье. Как это устроено