dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Одна ИИ-модель цитировала 98% медицинских утверждений, но полностью подтверждала лишь 37%

0

Кратко

Авторы проверили 12 языковых моделей на 222 искусственно составленных медицинских вопросах и материалах четырёх клинических руководств. Модели часто находили дословные цитаты, но эти цитаты нередко не подтверждали все детали утверждений; у одной модели полное подтверждение получили только 37,1% утверждений.

Зачем это знать

Цитата сама по себе ещё не делает медицинский ответ легко проверяемым: важно, подтверждает ли приведённый фрагмент весь смысл утверждения. Работа оценивает именно качество цитирования, а не общую правильность или пользу ответов. Это препринт, поэтому его результаты ещё не прошли независимую экспертную оценку.

Разбор

Авторы проверяли не общую «умность» медицинских ответов, а насколько быстро их можно перепроверить. Для этого они собрали тестовую систему на основе четырёх клинических руководств: модель должна была разделить ответ на отдельные фактические утверждения, для каждого найти источник и привести точный фрагмент текста из руководства. Затем исследователи отдельно оценили каждый шаг — есть ли ссылка, есть ли дословная цитата и покрывает ли она весь смысл утверждения, включая все его детали.

Такой подход нужен потому, что ссылка на большой документ мало помогает врачу, у которого нет времени перечитывать десятки страниц. Но короткая цитата тоже может вводить в заблуждение: она способна подтверждать лишь часть фразы, например рекомендацию в целом, но не конкретное условие, исключение или числовой порог. Именно на этом этапе чаще всего возникал разрыв: модели неплохо находили подходящие на вид фрагменты, но цитаты не всегда подтверждали утверждение целиком.

В тесте участвовали двенадцать моделей и 222 искусственно составленных клинических вопроса. Большинство моделей по одной только инструкции смогли прикрепить дословные фрагменты более чем к 90% утверждений; хуже справлялись некоторые небольшие модели, включая claude-haiku-4.5. Однако высокая доля цитат не означала высокую надёжность: у claude-opus-5 цитата нашлась для 98,0% утверждений, но полностью подтверждала их только в 37,1% случаев. Авторы предлагают эти результаты как основу для дальнейшей проверки систем, которые должны строить проверяемые медицинские ответы.

Ключевые цифры

12 моделейСравнили не один конкретный ИИ, а набор систем — поэтому видно, что проблема связана не только с одной моделью.
222 вопросаМодели проверяли на сотнях одинаково подготовленных заданий, а не на одном-двух примерах.
98,0%Почти для каждого утверждения одна из моделей нашла дословную цитату, но это ещё не говорит, что цитата подтверждает весь смысл.
37,1%Полностью подтверждена была примерно каждая третья фраза — многие цитаты покрывали лишь часть деталей утверждения.

Можно ли доверять

Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Кроме того, тест проходил на искусственных вопросах и текстах клинических руководств, а не на реальных консультациях и пациентах: результат показывает качество проверяемости цитат, но не доказывает, как модели будут работать в клинической практике.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас15 сентября 2026 г.
Дата источника14 сентября 2026 г.
ОригиналОткрыть
АвторыJiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst