Препринт — материал ещё не прошёл рецензирование
Видимые рассуждения медицинских ИИ часто не отражают причины ответов
Кратко
Авторы проверили 14 медицинских ИИ на четырёх наборах вопросов и 197 специально изменённых заданиях. В 72,9% случаев после клинически значимых искажений ни видимое пошаговое объяснение, ни ответ не менялись вместе с изменением задания. Повреждение объяснения или его удаление почти не меняли точность ответов. Проверка проходила на тестах, а не в реальной медицинской практике.
Зачем это знать
Правильный ответ медицинского ИИ ещё не означает, что видимое объяснение показывает настоящую причину этого ответа. Это ставит под сомнение использование таких объяснений как надёжного основания для медицинских решений.
Разбор
Авторы не просто сравнивали правильность ответов. Они устроили моделям «краш‑тест»: брали медицинский вопрос и по одному меняли в нём клинически важные детали — например, переворачивали тяжесть состояния, добавляли отрицание, меняли демографические данные или убирали часть свидетельств. Затем отдельно смотрели, отреагировала ли на это видимая цепочка рассуждений и изменился ли итоговый ответ. Такой совместный анализ помогает отличить осмысленное рассуждение от текста, который появляется уже после принятия решения.
Чтобы проверить, не считают ли сами авторы теста изменение вопроса ошибкой, два сертифицированных врача заново оценили изменённые задания. В подавляющем большинстве случаев они сочли исходный правильный ответ всё ещё обоснованным, поэтому результаты не объясняются массовым появлением неразрешимых вопросов. При этом среди случаев, где ответ всё-таки перевернулся после изменения, от 17,3% до 33,3% изменений оказались клинически вредными; оба врача независимо согласились в 13,3% случаев.
Ещё один важный результат: повреждение текста рассуждения не ухудшило точность, а просьба рассуждать пошагово не дала преимущества перед прямым ответом. Это наблюдалось независимо от размера модели, её дообучения на медицинских данных, специального обучения рассуждениям и ценового класса. Для закрытых моделей, которые не показывают внутреннюю цепочку, авторы нашли сходные признаки такого же разрыва по поведению самих ответов.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому его ещё не проверили рецензенты. Сильная сторона — 14 моделей, четыре набора медицинских вопросов и независимая оценка двух врачей; но проверка прошла на тестовых заданиях, а не на пациентах и реальных медицинских решениях.
Пересказано ИИ по научной статье. Как это устроено