Препринт — материал ещё не прошёл рецензирование
ИИ-системы для рака груди давали смешанные советы и часто ошибались
Кратко
Проверили системы на 72 реальных случаях рака груди и 1 147 наборах правил для оценки ответов. Лучший вариант набрал 0,594 ± 0,025, но качество сильно прыгало: где-то помогали инструменты и более самостоятельная работа, а где-то мешали.
Зачем это знать
Это сигнал, что такие системы пока недостаточно надёжны для автономного применения: они могут выдавать клинически похожие ответы, но всё ещё ошибаются и бывают чрезмерно уверенными. Значит, смотреть нужно не только на «ум», но и на стабильность работы в разных клинических ситуациях.
Разбор
Авторы проверили не просто «одну ИИ-модель», а несколько схем работы модели: где-то она отвечала сама, где-то получала доступ к внешним инструментам, а где-то внутри неё работали отдельные помощники-агенты, которые могли искать факты и перепроверять ответы. Смысл был в том, чтобы понять, помогает ли ИИ лучше разбирать сложные решения по лечению рака груди, если дать ему больше свободы и больше источников.
Для оценки взяли 72 реальных клинических случая рака груди на разных стадиях — от I до IV. Для каждого случая собрали набор правил проверки ответа: в сумме вышло 1 147 таких рубрик. Их делали по схеме, где генератор правил видел реальные клинические решения, а проверяемые модели — нет. Это важно: так оценка ближе к настоящей клинической задаче, а не к угадыванию по шаблону.
Результат получился не таким ровным, как хотелось бы. Лучшая конфигурация набрала 0,594 ± 0,025, но добавление инструментов и большей автономности не всегда улучшало качество: в одних случаях помогало, в других — наоборот, ухудшало ответы. Ещё авторы посмотрели, на каких именно областях ИИ чаще спотыкался, и нашли типичные сбои: неверные или пропущенные рекомендации, слабые объяснения, ошибки в ссылках, устаревшие утверждения и чрезмерную уверенность в себе.
То есть картина такая: системы уже могут выдавать ответы, которые выглядят клинически осмысленно, но стабильности им пока не хватает. Именно поэтому работа полезна не как демонстрация «умного ИИ», а как трезвая проверка того, где такие системы ещё ломаются в реальной онкологии.
Ключевые цифры
Можно ли доверять
Это arXiv-препринт, то есть статью ещё не проверили независимые рецензенты. При этом авторы тестировали модели на реальных клинических случаях и отдельно разбирали ошибки с участием онкологов, так что работа выглядит серьёзной. Но выборка всё же ограничена 72 случаями и одной задачей — рекомендациями по раку груди, поэтому переносить выводы на всю медицину стоит осторожно.
Пересказано ИИ по научной статье. Как это устроено