dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

ИИ-модели хорошо пишут ответы, но часто ошибаются в медицине

0

Кратко

В пяти сложных клинических сценариях три передовые языковые модели проходили лишь 32,4–41,7% самых важных критериев. При этом они почти идеально держали нужный формат и стиль ответа, но это слабо помогало угадать, насколько ответ был клинически правильным.

Зачем это знать

Это предупреждает, что по красивому и связному ответу нельзя надёжно судить о качестве медицинского вывода. Работа пока предварительная и основана всего на 5 сценариях, но она показывает, что для проверки медИИ нужны оценки именно по сути решения, а не только по внешнему виду текста.

Разбор

Авторы не просто посмотрели, «красиво ли» модель отвечает, а разобрали каждый клинический сценарий на отдельные маленькие проверки. Каждая такая проверка описывает один важный шаг: учла ли модель нужный симптом, не упустила ли риск, поняла ли, когда вмешательство лучше не назначать. Эти проверки ещё и взвесили по важности, чтобы случайная мелочь не спорила с тем, что действительно влияет на безопасность пациента.

Такой подход нужен потому, что обычные медицинские тесты уже во многом «забиты» — на них передовые модели набирают слишком высокие оценки, и это плохо показывает, где они реально ошибаются. Поэтому авторы специально собрали пять трудных сценариев от клиницистов из четырёх областей: анестезии, внутренней/семейной медицины, неотложки и акушерства. Сценарии были не из базы готовых вопросов, а из практических задач, где важно не просто угадать ответ, а собрать картину из противоречивых деталей.

Самое важное, что они увидели: модели часто справлялись с оформлением ответа и нужным стилем, но теряли именно клиническую суть. Иначе говоря, текст выглядел убедительно, а в решении не хватало ключевого вывода. Причём это особенно заметно на самых важных критериях: именно их модели пропускали чаще всего, а более «лёгкие» детали, наоборот, проходили гораздо лучше. В сумме 56 из 108 критических проверок не прошла ни одна из моделей.

Ещё один полезный результат — сам способ проверки. Авторы показали, что отдельные автоматические оценщики почти совпадают с экспертами в разметке «выполнено / не выполнено». Это значит, что такой метод можно масштабировать: не вручную разбирать каждый ответ, а строить крупный тест, который ловит не только форму, но и реальные клинические ошибки.

Ключевые цифры

5 сценариевПроверка пока очень небольшая: это хороший сигнал, но не доказательство для всей медицины.
4 специальностиОшибки искали не в одной узкой области, а в разных типах клинических задач.
184 критерияОтветы разбирали на множество отдельных проверок, поэтому система видит не общую «впечатляющесть», а конкретные промахи.
56 из 108Больше половины самых важных клинических проверок не смогла пройти ни одна из моделей.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверили другие учёные в рецензировании. С другой стороны, авторы не опирались на одну случайную выборку: они подробно разобрали пять сложных клинических сценариев и сравнили сразу три сильные модели. Но масштаб пока маленький, поэтому выводы стоит считать убедительным предупреждением, а не окончательным вердиктом для всех медицинских ИИ.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас3 июля 2026 г.
Дата источника2 июля 2026 г.
ОригиналОткрыть
АвторыSamiha A. Ismail, Fan X. Chen, Ali Merali