dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Схема из нескольких ИИ повысила точность диагноза на 10 пунктов против GPT-4o

0

Кратко

Авторы проверили схему, в которой несколько ИИ по очереди разбирают медицинский случай и обсуждают диагноз, на 297 случаях редких болезней и 1719 сложных случаях. По сравнению с GPT-4o она повысила точность наиболее вероятного диагноза на 10,21 процентного пункта, а оценку безопасности ответа — на 11,36 пункта.

Зачем это знать

В этих тестах организованный разбор несколькими ИИ дал более высокие оценки, чем одиночный ответ GPT-4o, в сложных медицинских задачах. Но проверка проходила на наборах описаний случаев, а не на лечении реальных людей, поэтому система не становится заменой врачу.

Разбор

Авторы хотели проверить не просто способность модели угадать диагноз, а более похожий на работу врачей процесс: сначала разные ИИ получают роли и по очереди разбирают случай, затем обсуждают версии и уточняют итог. Систему сравнивали с одиночными моделями, которым давали одинаковые инструкции: назвать самый вероятный диагноз и ещё три возможных варианта. Ответ считали правильным, если эталонный диагноз совпадал с главным или хотя бы с одним из трёх запасных вариантов.

Отдельно оценивали безопасность по нескольким критериям: не пропустила ли система опасный диагноз, не предлагает ли лишнее обследование, подходит ли ответ людям разных демографических групп и насколько уверенность соответствует качеству ответа. Это важно, потому что медицинская система может ошибиться не только в названии болезни, но и опасно недооценить риск или, наоборот, отправить пациента на ненужную цепочку проверок.

Дополнительные эксперименты показали, что результат нельзя объяснить лишь большим числом моделей или более длинными ответами. Важен именно порядок взаимодействия и распределение ролей. Лучше всего DMoA работала при структуре 4×2; ей также помогали более сильные исходные модели и больший лимит текста. Это подсказывает, что для сложной диагностики имеет значение не только «сколько ИИ» участвует, но и как организован их совместный разбор.

Ключевые цифры

4×2Это наиболее удачная из проверенных схем организации агентов: авторы нашли, что структура взаимодействия влияет на результат, а не только количество использованных моделей.
297 случаевОтдельный набор включал редкие болезни, где диагностические ошибки особенно легко пропустить из-за необычных признаков.
1 719 случаевЕщё один набор дал системе широкую проверку на сложных клинических описаниях, а не на нескольких единичных примерах.
3 возможных диагнозаПомимо главной версии, система должна была назвать три запасных варианта, поэтому проверка учитывала и способность держать в уме несколько объяснений.

Можно ли доверять

Это препринт на arXiv, поэтому работу ещё не проверили рецензенты журнала. Результаты получены на наборах текстовых описаний случаев, а не на реальных пациентах и не в процессе лечения; кроме того, сравнение с эталонным диагнозом не показывает, как система поведёт себя в клинике с неполными данными и последствиями ошибки.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас7 сентября 2026 г.
Дата источника4 сентября 2026 г.
ОригиналОткрыть
АвторыChang Xia, Leilei Ouyang, Huimin Wang, Yong Zhao, Kang Li