Препринт — материал ещё не прошёл рецензирование
ИИ-модели хорошо пишут ответы, но часто ошибаются в медицине
Кратко
В пяти сложных клинических сценариях три передовые языковые модели проходили лишь 32,4–41,7% самых важных критериев. При этом они почти идеально держали нужный формат и стиль ответа, но это слабо помогало угадать, насколько ответ был клинически правильным.
Зачем это знать
Это предупреждает, что по красивому и связному ответу нельзя надёжно судить о качестве медицинского вывода. Работа пока предварительная и основана всего на 5 сценариях, но она показывает, что для проверки медИИ нужны оценки именно по сути решения, а не только по внешнему виду текста.
Разбор
Авторы не просто посмотрели, «красиво ли» модель отвечает, а разобрали каждый клинический сценарий на отдельные маленькие проверки. Каждая такая проверка описывает один важный шаг: учла ли модель нужный симптом, не упустила ли риск, поняла ли, когда вмешательство лучше не назначать. Эти проверки ещё и взвесили по важности, чтобы случайная мелочь не спорила с тем, что действительно влияет на безопасность пациента.
Такой подход нужен потому, что обычные медицинские тесты уже во многом «забиты» — на них передовые модели набирают слишком высокие оценки, и это плохо показывает, где они реально ошибаются. Поэтому авторы специально собрали пять трудных сценариев от клиницистов из четырёх областей: анестезии, внутренней/семейной медицины, неотложки и акушерства. Сценарии были не из базы готовых вопросов, а из практических задач, где важно не просто угадать ответ, а собрать картину из противоречивых деталей.
Самое важное, что они увидели: модели часто справлялись с оформлением ответа и нужным стилем, но теряли именно клиническую суть. Иначе говоря, текст выглядел убедительно, а в решении не хватало ключевого вывода. Причём это особенно заметно на самых важных критериях: именно их модели пропускали чаще всего, а более «лёгкие» детали, наоборот, проходили гораздо лучше. В сумме 56 из 108 критических проверок не прошла ни одна из моделей.
Ещё один полезный результат — сам способ проверки. Авторы показали, что отдельные автоматические оценщики почти совпадают с экспертами в разметке «выполнено / не выполнено». Это значит, что такой метод можно масштабировать: не вручную разбирать каждый ответ, а строить крупный тест, который ловит не только форму, но и реальные клинические ошибки.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверили другие учёные в рецензировании. С другой стороны, авторы не опирались на одну случайную выборку: они подробно разобрали пять сложных клинических сценариев и сравнили сразу три сильные модели. Но масштаб пока маленький, поэтому выводы стоит считать убедительным предупреждением, а не окончательным вердиктом для всех медицинских ИИ.
Пересказано ИИ по научной статье. Как это устроено