Препринт — материал ещё не прошёл рецензирование
Медицинская модель почти всегда недооценивала риск во французских и арабских тестах
Кратко
Авторы проверили, понимает ли одна многоязычная модель сообщения о женском здоровье в шести формах: стандартной, клинической, бытовой, осторожной, эмоциональной и намеренно неполной. При настройке, где языки по-разному влияли на оценку риска, модель недооценивала опасность в 99,4% случаев во французских и арабских тестах. Использование одинаковых обозначений уровня риска для разных языков снизило этот показатель до 57,2% и 55,8%.
Зачем это знать
Результат показывает, что одной общей точности недостаточно для оценки безопасности медицинских ИИ-систем. Пока проверили одну модель в контролируемых сценариях, поэтому неизвестно, как такой сбой проявится в реальных консультациях.
Разбор
Авторы собрали набор парных медицинских сообщений: один и тот же случай описывали на английском, французском и современном литературном арабском. В пяти вариантах — от клинического до бытового и эмоционального — сохраняли всю важную информацию, но меняли манеру речи. Шестой вариант специально делали неполным: из него убирали детали, чтобы проверить, поймёт ли модель, что сначала нужно задать уточняющий вопрос, а не сразу оценивать риск.
Модель проверяли не только по правильности ответа. Авторы отдельно смотрели, одинаково ли она понимает один случай в разных языках и стилях, умеет ли признавать неопределённость, соблюдает ли заданный формат и правильно ли распределяет уровни риска. Затем они сравнили обычную многоязычную настройку с вариантами, дообученными методом QLoRA — это способ изменить модель с небольшими затратами, не переписывая все её параметры.
Главная находка — высокая общая точность и внешняя согласованность могли скрывать опасный перекос: модель систематически выбирала слишком низкий уровень срочности именно для французских и арабских сообщений. Отдельный контрольный эксперимент показал возможную причину: при дообучении языки получали несимметричные правила разметки риска. Когда авторы заменили их на метки, одинаково определённые для всех языков и выведенные из исходных данных, ошибка заметно уменьшилась, но не исчезла. Это говорит о том, что проверять медицинскую модель нужно не только на содержании ответа, но и на том, как устроены данные для её настройки.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не прошла независимая проверка рецензентами. Тест был контролируемым и охватывал одну многоязычную модель и её варианты, а не реальные консультации с пациентами; поэтому результат хорошо показывает конкретный риск, но не даёт точной оценки для всех медицинских ИИ-систем.
Пересказано ИИ по научной статье. Как это устроено