Препринт — материал ещё не прошёл рецензирование
MediSkill-Evo повысил точность диагностики на тестах с 61% до 69%
Кратко
В 300 смоделированных беседах MediSkill-Evo точнее ставил диагнозы, чаще охватывал нужные лечебные действия — 66,44% против 33,62%, — и реже допускал критические ошибки: 16,33% против 31%. Оценка проходила на фиксированных тестах и с помощью автоматических проверок, поэтому она не подтверждает готовность ИИ к работе с пациентами.
Зачем это знать
Это ранний ориентир того, как медицинский ИИ ведёт весь разговор и опирается на найденные сведения, а не только формулирует диагноз. Чтобы понять, работает ли такой подход в клинике, систему нужно проверять отдельно: здесь оценивалась только полная система на фиксированных сценариях.
Разбор
Авторы не переобучали базовую модель, а добавили к ней управляемую память из четырёх отдельных частей: клинических навыков, правил ведения процесса, схем для представления сведений и процедур измерений. Новые записи попадали в рабочую версию памяти только после проверки происхождения, подтверждений, возможности повторить рассуждение и правил безопасности. На этапе ответа система привязывала каждое найденное доказательство к источнику, отбрасывала недопустимые действия и ставила безопасность выше других критериев.
Такой подход нужен потому, что медицинский агент должен не только назвать диагноз, но и правильно собирать сведения, учитывать их временную последовательность и реагировать на тревожные признаки. Раньше разные виды опыта часто складывали в один общий механизм поиска, хотя для правила триажа, клинического приёма и результата измерения нужны разные ограничения. Авторы сравнили целые системы на двух базовых моделях и шести специально контролируемых типах стресса, сохранив одинаковое ограничение на число ходов врача.
В отдельных жёстких проверках, построенных на 30 случаях, система восстановила нужную цель в 93,61% ситуаций под давлением поведения пациента, во всех проверках с временными сведениями и в 92,22% случаев с тревожными признаками триажа. При этом три других показателя автоматических ошибок оказались нулевыми у всех сравниваемых систем — поэтому они не показывают особого преимущества MediSkill-Evo. Дополнительное сравнение на 100 случаях с MedSAM авторы трактуют лишь как проверку возможности интерфейса инструментов, а не как полноценное медицинское испытание.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая рецензирование. Авторы проверили полные системы на фиксированных тестовых наборах, а часть оценок поставил автоматический судья; кроме того, внутренние обращения к модели, расход токенов и сложность вопросов не выравнивали. Поэтому результаты показывают работу именно этой конфигурации на этих тестах, но не доказывают причинный эффект отдельных компонентов и не подтверждают готовность к клиническому применению.
Пересказано ИИ по научной статье. Как это устроено