dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ-оценщик почти сравнялся с врачами, но не проявлял осторожности

0

Кратко

В немецком медицинском бенчмарке MedQADE проверили 3 800 открытых ответов, которые оценивали десять врачей и девять языковых моделей. Лучший ИИ-оценщик, Gemini 3 Flash, по согласованности оказался почти на уровне врачей: 0,694 против 0,709, но доверительные интервалы были широкими. При этом модели почти всегда ставили окончательную оценку, тогда как врачи чаще учитывали сложность задания и могли воздержаться от ответа. Авторы также заметили предвзятость в пользу «родственных» моделей одной архитектуры.

Зачем это знать

Для оценки медицинских ИИ мало добиться похожих баллов: ещё нужно проверять, умеет ли оценщик останавливаться там, где человек был бы осторожен. Эта работа показывает, что автоматическую проверку в медицине нельзя принимать на веру без отдельной проверки на независимость и сдержанность.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас2 июля 2026 г.
Дата источника1 июля 2026 г.
ОригиналОткрыть
АвторыWilliam Philipp, Finn Fassbender, Thorsten Langer, Martje Pauly, Rebecca Herzog, Alexander Baumann, Markus Hobert, Theresa Paulus, Ip Chi Wang, Lukas Goede