dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Видимые рассуждения медицинских ИИ часто не отражают причины ответов

0

Кратко

Авторы проверили 14 медицинских ИИ на четырёх наборах вопросов и 197 специально изменённых заданиях. В 72,9% случаев после клинически значимых искажений ни видимое пошаговое объяснение, ни ответ не менялись вместе с изменением задания. Повреждение объяснения или его удаление почти не меняли точность ответов. Проверка проходила на тестах, а не в реальной медицинской практике.

Зачем это знать

Правильный ответ медицинского ИИ ещё не означает, что видимое объяснение показывает настоящую причину этого ответа. Это ставит под сомнение использование таких объяснений как надёжного основания для медицинских решений.

Разбор

Авторы не просто сравнивали правильность ответов. Они устроили моделям «краш‑тест»: брали медицинский вопрос и по одному меняли в нём клинически важные детали — например, переворачивали тяжесть состояния, добавляли отрицание, меняли демографические данные или убирали часть свидетельств. Затем отдельно смотрели, отреагировала ли на это видимая цепочка рассуждений и изменился ли итоговый ответ. Такой совместный анализ помогает отличить осмысленное рассуждение от текста, который появляется уже после принятия решения.

Чтобы проверить, не считают ли сами авторы теста изменение вопроса ошибкой, два сертифицированных врача заново оценили изменённые задания. В подавляющем большинстве случаев они сочли исходный правильный ответ всё ещё обоснованным, поэтому результаты не объясняются массовым появлением неразрешимых вопросов. При этом среди случаев, где ответ всё-таки перевернулся после изменения, от 17,3% до 33,3% изменений оказались клинически вредными; оба врача независимо согласились в 13,3% случаев.

Ещё один важный результат: повреждение текста рассуждения не ухудшило точность, а просьба рассуждать пошагово не дала преимущества перед прямым ответом. Это наблюдалось независимо от размера модели, её дообучения на медицинских данных, специального обучения рассуждениям и ценового класса. Для закрытых моделей, которые не показывают внутреннюю цепочку, авторы нашли сходные признаки такого же разрыва по поведению самих ответов.

Ключевые цифры

30 операторовСтолько разных способов клинически осмысленно меняли вопросы и видимые рассуждения, чтобы проверить реакцию моделей на конкретные искажения.
197 изменённых вопросовТакой объём заданий два врача проверили вручную, чтобы понять, не стали ли сами тестовые вопросы спорными.
98,5%Почти во всех изменённых заданиях врачи сочли исходный правильный ответ всё ещё защищаемым, то есть большинство тестов не превратилось в очевидную ошибку из-за редактирования.
13,3%В такой доле случаев оба врача согласились, что изменение ответа модели было клинически вредным.

Можно ли доверять

Это препринт arXiv, поэтому его ещё не проверили рецензенты. Сильная сторона — 14 моделей, четыре набора медицинских вопросов и независимая оценка двух врачей; но проверка прошла на тестовых заданиях, а не на пациентах и реальных медицинских решениях.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас26 августа 2026 г.
Дата источника25 августа 2026 г.
ОригиналОткрыть
АвторыMengzhu Xu, Jifan Gao, Xia Jiang, Yaoxin Wu, Xi Long