dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

LLM теряют точность в медицинских ответах под ложным контекстом

0

Кратко

Представлен бенчмарк MedMisBench для проверки того, сохраняет ли модель правильный ответ, если в задачу подмешать misleading medical context. На 11 конфигурациях LLM точность падала с 71,1% до 38,0%, а успешность атак доходила до 51,5%.

Зачем это знать

Это показывает уязвимость медицинских LLM не к знаниям вообще, а к тому, как они держатся при сбивающем контексте. Но работа предварительная и относится к тестовому набору и конкретным моделям, поэтому её не стоит напрямую переводить в клинические рекомендации.

Разбор

Авторы проверили не просто «знает ли модель медицину», а может ли она удержать верный ответ, когда в вопрос незаметно подсовывают убедительно звучащую, но ложную подсказку. Для этого они собрали MedMisBench — набор из 10 932 медицинских вопросов и почти 49 тысяч пар с вредящим контекстом, чтобы посмотреть, как меняется ответ модели под таким давлением.

Здесь важен сам подход: вопрос сначала берут в исходном виде, а потом добавляют сбивающий фрагмент, который выглядит как авторитетное объяснение, исключение из правила или другое «правдоподобное» медицинское утверждение. Так можно увидеть, что именно ломается: не общая эрудиция модели, а устойчивость её суждения в ситуации, похожей на реальный разговор, где рядом с полезной информацией может оказаться мусор или дезинформация.

Самое неприятное открытие — модели, которые хорошо отвечают на «чистые» вопросы, заметно сдают, когда контекст специально искажают. Причём это происходит не точечно: эффект виден на всех проверенных конфигурациях, а особенно опасными оказались ложные формулировки, которые звучат как правила или как исключения из правил. Отдельно клиницисты оценили часть ответов и показали, что заметная доля таких сбоев может нести серьёзный вред для пациента.

Ключевые цифры

10 932Столько медицинских вопросов включили в новый тест — это уже не маленькая подборка, а серьёзная проверка на устойчивость к сбивающему контексту.
48 889Столько пар с ложным контекстом подготовили, чтобы многократно «сбивать с курса» одну и ту же модель и смотреть, где она ломается.
71,1%Столько правильных ответов модели давали на обычные вопросы без подмешанной дезинформации.
38,0%До такого уровня падала точность, когда в вопрос добавляли вводящий в заблуждение медицинский контекст.
51,5%В половине случаев и чаще ложная подсказка действительно заставляла модель уйти от правильного ответа.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Сильная сторона — большой тестовый набор и проверка на 11 конфигурациях моделей, но всё это всё равно лабораторная оценка: на реальных клинических разговорах и в других системах цифры могут быть другими. Дополнительный плюс в том, что часть примеров смотрела клиническая панель из 14 специалистов из 7 стран, но и это не заменяет проверку в живой практике.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыHongjian Zhou, Xinyu Zou, Jinge Wu, Sean Wu, Junchi Yu, Bradley Max Segal, Tobias Erich Niebuhr, Sara Amro, Michael Petrus, Sheikh Momin