Препринт — материал ещё не прошёл рецензирование
Преимущество алгоритма над врачами не подтвердилось
Кратко
Авторы проверили пять семейств алгоритмов на данных о 44 894 пациентах с ишемическим инсультом; всего в регистре было 129 033 записи. Оказалось, что исходная оценка частично отражала тяжесть состояния и прогноз пациентов, а не пользу лечения: после устранения этого смешения преимущество снизилось до +0,0025 и перестало отличаться от случайного колебания.
Зачем это знать
Хорошие оценки ИИ по старым медицинским данным сами по себе ещё не доказывают улучшения лечения. Для такого вывода нужны дополнительные проверки на реальных пациентах, а не только анализ архивов и компьютерные расчёты.
Разбор
Авторы не ограничились одним алгоритмом и одной формулой «награды» — числом, по которому обучение понимает, что лечение было успешным. Они сравнили пять семейств алгоритмов офлайн-обучения с подкреплением, то есть методов, которые учатся на уже собранных медицинских записях, и 14 вариантов такой награды. Затем проверили результат несколькими независимыми способами: оценивали ожидаемый исход, сравнивали пациентов с похожими исходными данными и отдельно анализировали повторные события.
Главная проблема оказалась не в выборе конкретного алгоритма, а в самих данных. Конечная оценка могла одновременно отражать тяжесть инсульта и эффективность назначенного лечения. Тогда алгоритм получает «кредит» за хороший или плохой прогноз пациента, хотя сам не повлиял на исход. Авторы убрали эту примесь с помощью модели градиентного бустинга — метода, который последовательно уточняет прогноз, — и получили гораздо более слабый сигнал. Проверка исхода через год дала тот же результат: первоначальное преимущество исчезло после очистки оценки.
В общей проверке ни одно из пяти семейств не дало убедительных свидетельств улучшения. Различия между больницами тоже пропали после полной очистки, а различия между группами пациентов по шкале тяжести инсульта авторы предлагают использовать только как идеи для будущих проспективных испытаний — исследований, где лечение заранее задают и наблюдают за пациентами вперёд во времени. В конце они сформулировали чек-лист из шести шагов, который помогает выявлять такие ошибки до того, как результат офлайн-анализа примут за доказательство пользы.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому его ещё не проверили независимые рецензенты. Данные масштабные, но исследование анализирует уже случившееся лечение в регистре, а не проверяет стратегию алгоритма в проспективном клиническом испытании; кроме того, итог зависит от качества медицинских записей и выбранных способов очистки оценки.
Пересказано ИИ по научной статье. Как это устроено