Препринт — материал ещё не прошёл рецензирование
ИИ реже выдавал опасные советы на медицинских тестах
Кратко
Авторы обучили 7-миллиардную модель учитывать ограничения работы организма и проверили её на 2500 искусственных медицинских сценариях. Доля опасных рекомендаций по оценке врачей снизилась с 14,1% до 5,1%, а общий показатель безопасности вырос с 69,5% до 90,8% по сравнению с прежним способом обучения.
Зачем это знать
Метод обучения с учётом физиологических ограничений помог модели чаще избегать рекомендаций, несовместимых с нормальной работой организма, на контролируемом тесте. Перенос такого улучшения на реальные медицинские данные и пациентов ещё не проверен.
Разбор
Авторы не просто добавили медицинские статьи в базу знаний модели. Они связали языковую модель с графом из 847 тысяч узлов: в нём записаны связи между болезнями, препаратами, симптомами и процессами в организме. Отдельный модуль проверял каждый вариант ответа по трём направлениям: не нарушает ли он равновесие работы организма, правдоподобна ли цепочка медицинских связей и нет ли опасного взаимодействия лекарств. Эти оценки использовали прямо во время дообучения, а не только после генерации ответа.
Такой подход важен потому, что текст может звучать убедительно и при этом противоречить базовой физиологии. Раньше модель в основном училась на примерах хороших и плохих ответов или получала подсказки из внешней базы уже во время работы. Здесь же правила безопасности влияют на само обучение: модель снова и снова генерирует ответы, получает их ранжирование и подстраивается под него. При этом проверка независимым набором правил дала близкий результат — 86,4% против 90,8% по основному показателю, что снижает риск объяснить успех особенностями одного проверяющего модуля.
Проверка показала и границы метода. При добавлении шума, имитирующего неидеальные электронные медицинские записи, показатель безопасности сохранился на уровне 84,2%. Разбор по частям показал, что наибольший вклад дали именно оценка графом и повторное обучение, а не простое знакомство с медицинскими примерами. Но все сценарии оставались искусственными: авторы не проверяли рекомендации на реальных историях болезни и не сравнивали систему с сопоставимым клиническим вариантом PPO/RLHF — другим популярным способом обучения моделей через подкрепление.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому его ещё не проверили независимые рецензенты. Результаты получены на 2 500 искусственных сценариях, а не на пациентах; кроме того, в сравнении не было сопоставимой по масштабу системы PPO/RLHF. Поэтому работа убедительно показывает эффект на тесте, но не доказывает безопасность для клинического применения.
Пересказано ИИ по научной статье. Как это устроено