dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

В искусственных консультациях Doctorina чаще, чем врачи, выбирала правильный диагноз

0

Кратко

В 150 искусственно составленных консультациях на польском языке система Doctorina совпала с заранее заданным правильным диагнозом в 82% случаев, а восемь врачей — в 57%. Она также получила более высокие оценки предложенных обследований и начального лечения, когда сама решала, какие сведения запросить.

Зачем это знать

Так можно проверять медицинские системы не только по диагнозу, но и по следующим решениям. Однако здесь сравнивали искусственно составленные консультации, а не лечение реальных людей, поэтому результат нельзя напрямую переносить на клиническую практику.

Разбор

Doctorina проверяли не на готовых историях болезни, где все сведения уже лежат перед системой. В каждом диалоге она сама решала, какие уточняющие вопросы задать, а затем выдавала диагноз, список обследований и начальное лечение. Такой формат ближе к обычной консультации: результат зависит не только от умения распознать болезнь, но и от того, какую информацию удалось добыть.

Авторы сравнили систему с восемью врачами и четырьмя отдельными большими языковыми моделями на 150 искусственно составленных консультациях на польском языке. Помимо совпадения с одним заранее заданным диагнозом, они учитывали более широкий вариант: правильный диагноз или диагноз из допустимого дифференциального списка. В этом варианте Doctorina набрала 97,3%, а врачи — 85,0%.

Преимущество оказалось не только диагностическим. Оценки обследований составили 89,4 против 66,9, а начального лечения — 83,7 против 61,2 по приведённой к единой шкале. Повторный запуск Doctorina снова дал преимущество перед врачами по всем основным показателям. При этом среди отдельных моделей разрыв был меньше: Kimi K3 оказался следующим по диагностике, а Claude Opus 5 получил немного более высокие оценки за ведение случаев, чем Doctorina.

Ключевые цифры

97,3% против 85,0%Если засчитывать не только один точный диагноз, но и приемлемые варианты из списка, система заметно чаще попадала в клинически допустимый ответ.
89,4 против 66,9По единой шкале система получила более высокие оценки за то, какие обследования предлагала назначить.
83,7 против 61,2Планы начального лечения Doctorina тоже оценили выше, чем планы врачей в этом тесте.
95% ДИ: 17,7–32,7 процентного пунктаДаже с учётом статистической неопределённости преимущество системы в точном диагнозе оставалось заметным.

Можно ли доверять

Это препринт arXiv, поэтому независимая экспертная проверка ещё не завершена. Кроме того, проверка прошла на 150 синтетических консультациях и только восьми врачах, а сама система сочетает языковые модели с клинической надстройкой — авторы не отделяли вклад одного от другого. Поэтому результат показывает сильную работу в данном формате теста, но не доказывает превосходство над врачами в реальной клинике.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас9 сентября 2026 г.
Дата источника8 сентября 2026 г.
ОригиналОткрыть
АвторыAndy Nkansah, Hanna Plotnitskaya, Stanislau Salavei, Anna Kozlova, Piotr Gibas, Julian Milek, Viktar Harbachou, Aleksey Ropan, Pavel Satalkin