Препринт — материал ещё не прошёл рецензирование
Схема из нескольких ИИ повысила точность диагноза на 10 пунктов против GPT-4o
Кратко
Авторы проверили схему, в которой несколько ИИ по очереди разбирают медицинский случай и обсуждают диагноз, на 297 случаях редких болезней и 1719 сложных случаях. По сравнению с GPT-4o она повысила точность наиболее вероятного диагноза на 10,21 процентного пункта, а оценку безопасности ответа — на 11,36 пункта.
Зачем это знать
В этих тестах организованный разбор несколькими ИИ дал более высокие оценки, чем одиночный ответ GPT-4o, в сложных медицинских задачах. Но проверка проходила на наборах описаний случаев, а не на лечении реальных людей, поэтому система не становится заменой врачу.
Разбор
Авторы хотели проверить не просто способность модели угадать диагноз, а более похожий на работу врачей процесс: сначала разные ИИ получают роли и по очереди разбирают случай, затем обсуждают версии и уточняют итог. Систему сравнивали с одиночными моделями, которым давали одинаковые инструкции: назвать самый вероятный диагноз и ещё три возможных варианта. Ответ считали правильным, если эталонный диагноз совпадал с главным или хотя бы с одним из трёх запасных вариантов.
Отдельно оценивали безопасность по нескольким критериям: не пропустила ли система опасный диагноз, не предлагает ли лишнее обследование, подходит ли ответ людям разных демографических групп и насколько уверенность соответствует качеству ответа. Это важно, потому что медицинская система может ошибиться не только в названии болезни, но и опасно недооценить риск или, наоборот, отправить пациента на ненужную цепочку проверок.
Дополнительные эксперименты показали, что результат нельзя объяснить лишь большим числом моделей или более длинными ответами. Важен именно порядок взаимодействия и распределение ролей. Лучше всего DMoA работала при структуре 4×2; ей также помогали более сильные исходные модели и больший лимит текста. Это подсказывает, что для сложной диагностики имеет значение не только «сколько ИИ» участвует, но и как организован их совместный разбор.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому работу ещё не проверили рецензенты журнала. Результаты получены на наборах текстовых описаний случаев, а не на реальных пациентах и не в процессе лечения; кроме того, сравнение с эталонным диагнозом не показывает, как система поведёт себя в клинике с неполными данными и последствиями ошибки.
Пересказано ИИ по научной статье. Как это устроено