Препринт — материал ещё не прошёл рецензирование
LLM теряют точность в медицинских ответах под ложным контекстом
Кратко
Представлен бенчмарк MedMisBench для проверки того, сохраняет ли модель правильный ответ, если в задачу подмешать misleading medical context. На 11 конфигурациях LLM точность падала с 71,1% до 38,0%, а успешность атак доходила до 51,5%.
Зачем это знать
Это показывает уязвимость медицинских LLM не к знаниям вообще, а к тому, как они держатся при сбивающем контексте. Но работа предварительная и относится к тестовому набору и конкретным моделям, поэтому её не стоит напрямую переводить в клинические рекомендации.
Разбор
Авторы проверили не просто «знает ли модель медицину», а может ли она удержать верный ответ, когда в вопрос незаметно подсовывают убедительно звучащую, но ложную подсказку. Для этого они собрали MedMisBench — набор из 10 932 медицинских вопросов и почти 49 тысяч пар с вредящим контекстом, чтобы посмотреть, как меняется ответ модели под таким давлением.
Здесь важен сам подход: вопрос сначала берут в исходном виде, а потом добавляют сбивающий фрагмент, который выглядит как авторитетное объяснение, исключение из правила или другое «правдоподобное» медицинское утверждение. Так можно увидеть, что именно ломается: не общая эрудиция модели, а устойчивость её суждения в ситуации, похожей на реальный разговор, где рядом с полезной информацией может оказаться мусор или дезинформация.
Самое неприятное открытие — модели, которые хорошо отвечают на «чистые» вопросы, заметно сдают, когда контекст специально искажают. Причём это происходит не точечно: эффект виден на всех проверенных конфигурациях, а особенно опасными оказались ложные формулировки, которые звучат как правила или как исключения из правил. Отдельно клиницисты оценили часть ответов и показали, что заметная доля таких сбоев может нести серьёзный вред для пациента.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Сильная сторона — большой тестовый набор и проверка на 11 конфигурациях моделей, но всё это всё равно лабораторная оценка: на реальных клинических разговорах и в других системах цифры могут быть другими. Дополнительный плюс в том, что часть примеров смотрела клиническая панель из 14 специалистов из 7 стран, но и это не заменяет проверку в живой практике.
Пересказано ИИ по научной статье. Как это устроено