Препринт — материал ещё не прошёл рецензирование
Одна ИИ-модель цитировала 98% медицинских утверждений, но полностью подтверждала лишь 37%
Кратко
Авторы проверили 12 языковых моделей на 222 искусственно составленных медицинских вопросах и материалах четырёх клинических руководств. Модели часто находили дословные цитаты, но эти цитаты нередко не подтверждали все детали утверждений; у одной модели полное подтверждение получили только 37,1% утверждений.
Зачем это знать
Цитата сама по себе ещё не делает медицинский ответ легко проверяемым: важно, подтверждает ли приведённый фрагмент весь смысл утверждения. Работа оценивает именно качество цитирования, а не общую правильность или пользу ответов. Это препринт, поэтому его результаты ещё не прошли независимую экспертную оценку.
Разбор
Авторы проверяли не общую «умность» медицинских ответов, а насколько быстро их можно перепроверить. Для этого они собрали тестовую систему на основе четырёх клинических руководств: модель должна была разделить ответ на отдельные фактические утверждения, для каждого найти источник и привести точный фрагмент текста из руководства. Затем исследователи отдельно оценили каждый шаг — есть ли ссылка, есть ли дословная цитата и покрывает ли она весь смысл утверждения, включая все его детали.
Такой подход нужен потому, что ссылка на большой документ мало помогает врачу, у которого нет времени перечитывать десятки страниц. Но короткая цитата тоже может вводить в заблуждение: она способна подтверждать лишь часть фразы, например рекомендацию в целом, но не конкретное условие, исключение или числовой порог. Именно на этом этапе чаще всего возникал разрыв: модели неплохо находили подходящие на вид фрагменты, но цитаты не всегда подтверждали утверждение целиком.
В тесте участвовали двенадцать моделей и 222 искусственно составленных клинических вопроса. Большинство моделей по одной только инструкции смогли прикрепить дословные фрагменты более чем к 90% утверждений; хуже справлялись некоторые небольшие модели, включая claude-haiku-4.5. Однако высокая доля цитат не означала высокую надёжность: у claude-opus-5 цитата нашлась для 98,0% утверждений, но полностью подтверждала их только в 37,1% случаев. Авторы предлагают эти результаты как основу для дальнейшей проверки систем, которые должны строить проверяемые медицинские ответы.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Кроме того, тест проходил на искусственных вопросах и текстах клинических руководств, а не на реальных консультациях и пациентах: результат показывает качество проверяемости цитат, но не доказывает, как модели будут работать в клинической практике.
Пересказано ИИ по научной статье. Как это устроено