dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Преимущество алгоритма над врачами не подтвердилось

0

Кратко

Авторы проверили пять семейств алгоритмов на данных о 44 894 пациентах с ишемическим инсультом; всего в регистре было 129 033 записи. Оказалось, что исходная оценка частично отражала тяжесть состояния и прогноз пациентов, а не пользу лечения: после устранения этого смешения преимущество снизилось до +0,0025 и перестало отличаться от случайного колебания.

Зачем это знать

Хорошие оценки ИИ по старым медицинским данным сами по себе ещё не доказывают улучшения лечения. Для такого вывода нужны дополнительные проверки на реальных пациентах, а не только анализ архивов и компьютерные расчёты.

Разбор

Авторы не ограничились одним алгоритмом и одной формулой «награды» — числом, по которому обучение понимает, что лечение было успешным. Они сравнили пять семейств алгоритмов офлайн-обучения с подкреплением, то есть методов, которые учатся на уже собранных медицинских записях, и 14 вариантов такой награды. Затем проверили результат несколькими независимыми способами: оценивали ожидаемый исход, сравнивали пациентов с похожими исходными данными и отдельно анализировали повторные события.

Главная проблема оказалась не в выборе конкретного алгоритма, а в самих данных. Конечная оценка могла одновременно отражать тяжесть инсульта и эффективность назначенного лечения. Тогда алгоритм получает «кредит» за хороший или плохой прогноз пациента, хотя сам не повлиял на исход. Авторы убрали эту примесь с помощью модели градиентного бустинга — метода, который последовательно уточняет прогноз, — и получили гораздо более слабый сигнал. Проверка исхода через год дала тот же результат: первоначальное преимущество исчезло после очистки оценки.

В общей проверке ни одно из пяти семейств не дало убедительных свидетельств улучшения. Различия между больницами тоже пропали после полной очистки, а различия между группами пациентов по шкале тяжести инсульта авторы предлагают использовать только как идеи для будущих проспективных испытаний — исследований, где лечение заранее задают и наблюдают за пациентами вперёд во времени. В конце они сформулировали чек-лист из шести шагов, который помогает выявлять такие ошибки до того, как результат офлайн-анализа примут за доказательство пользы.

Ключевые цифры

5 семейств алгоритмовРезультат проверили не на одном удачном методе, а на нескольких основных типах алгоритмов.
14 вариантов наградыАвторы отдельно проверили, как меняется вывод при разных способах определить для алгоритма хороший исход.
218,6%Искажение, связанное с тем, как в данные встроили конечную награду, объяснило даже больше наблюдаемого изменения сигнала — после его устранения оценка перешла за нулевую точку.
35 744 пациентаСтолько пациентов имели данные для отдельной проверки исхода через год, поэтому вывод не опирается только на ближайший результат лечения.

Можно ли доверять

Это препринт на arXiv, поэтому его ещё не проверили независимые рецензенты. Данные масштабные, но исследование анализирует уже случившееся лечение в регистре, а не проверяет стратегию алгоритма в проспективном клиническом испытании; кроме того, итог зависит от качества медицинских записей и выбранных способов очистки оценки.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас1 сентября 2026 г.
Дата источника31 августа 2026 г.
ОригиналОткрыть
АвторыKihun Rhee