Препринт — материал ещё не прошёл рецензирование
ИИ-оценщик почти сравнялся с врачами, но не проявлял осторожности
Кратко
В немецком медицинском бенчмарке MedQADE проверили 3 800 открытых ответов, которые оценивали десять врачей и девять языковых моделей. Лучший ИИ-оценщик, Gemini 3 Flash, по согласованности оказался почти на уровне врачей: 0,694 против 0,709, но доверительные интервалы были широкими. При этом модели почти всегда ставили окончательную оценку, тогда как врачи чаще учитывали сложность задания и могли воздержаться от ответа. Авторы также заметили предвзятость в пользу «родственных» моделей одной архитектуры.
Зачем это знать
Для оценки медицинских ИИ мало добиться похожих баллов: ещё нужно проверять, умеет ли оценщик останавливаться там, где человек был бы осторожен. Эта работа показывает, что автоматическую проверку в медицине нельзя принимать на веру без отдельной проверки на независимость и сдержанность.
Пересказано ИИ по научной статье. Как это устроено