dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

ИИ реже выдавал опасные советы на медицинских тестах

0

Кратко

Авторы обучили 7-миллиардную модель учитывать ограничения работы организма и проверили её на 2500 искусственных медицинских сценариях. Доля опасных рекомендаций по оценке врачей снизилась с 14,1% до 5,1%, а общий показатель безопасности вырос с 69,5% до 90,8% по сравнению с прежним способом обучения.

Зачем это знать

Метод обучения с учётом физиологических ограничений помог модели чаще избегать рекомендаций, несовместимых с нормальной работой организма, на контролируемом тесте. Перенос такого улучшения на реальные медицинские данные и пациентов ещё не проверен.

Разбор

Авторы не просто добавили медицинские статьи в базу знаний модели. Они связали языковую модель с графом из 847 тысяч узлов: в нём записаны связи между болезнями, препаратами, симптомами и процессами в организме. Отдельный модуль проверял каждый вариант ответа по трём направлениям: не нарушает ли он равновесие работы организма, правдоподобна ли цепочка медицинских связей и нет ли опасного взаимодействия лекарств. Эти оценки использовали прямо во время дообучения, а не только после генерации ответа.

Такой подход важен потому, что текст может звучать убедительно и при этом противоречить базовой физиологии. Раньше модель в основном училась на примерах хороших и плохих ответов или получала подсказки из внешней базы уже во время работы. Здесь же правила безопасности влияют на само обучение: модель снова и снова генерирует ответы, получает их ранжирование и подстраивается под него. При этом проверка независимым набором правил дала близкий результат — 86,4% против 90,8% по основному показателю, что снижает риск объяснить успех особенностями одного проверяющего модуля.

Проверка показала и границы метода. При добавлении шума, имитирующего неидеальные электронные медицинские записи, показатель безопасности сохранился на уровне 84,2%. Разбор по частям показал, что наибольший вклад дали именно оценка графом и повторное обучение, а не простое знакомство с медицинскими примерами. Но все сценарии оставались искусственными: авторы не проверяли рекомендации на реальных историях болезни и не сравнивали систему с сопоставимым клиническим вариантом PPO/RLHF — другим популярным способом обучения моделей через подкрепление.

Ключевые цифры

847 000 узловМодель опиралась на очень крупную карту медицинских связей, а не на несколько разрозненных правил.
86,4%Независимый набор правил получил высокий результат безопасности и подтвердил основную оценку другим способом.
84,2%Даже при искусственно зашумлённых данных система сохранила большую часть безопасного поведения.
200 врачебных оценокНастройку уверенности внутреннего показателя проверили на разметке специалистов, а не только на автоматических правилах.

Можно ли доверять

Это препринт arXiv, поэтому его ещё не проверили независимые рецензенты. Результаты получены на 2 500 искусственных сценариях, а не на пациентах; кроме того, в сравнении не было сопоставимой по масштабу системы PPO/RLHF. Поэтому работа убедительно показывает эффект на тесте, но не доказывает безопасность для клинического применения.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас26 августа 2026 г.
Дата источника25 августа 2026 г.
ОригиналОткрыть
АвторыAbdulhady Abas Abdullah, Erik Cambria, Milena Zivkovic