Препринт — материал ещё не прошёл рецензирование
Ручную полную проверку письменных работ можно сократить минимум наполовину
Кратко
Авторы испытали схему на двух выпусках общенационального теста — примерно по 5 000 ответов в каждом. В экспериментах без реального внедрения она направляла на полную проверку прежде всего спорные случаи: оценки ИИ в большинстве параметров достаточно хорошо совпадали с оценками экспертов, а ручную нагрузку можно было сократить как минимум наполовину.
Зачем это знать
Если результат подтвердится при реальном внедрении, проверяющие смогут тратить больше времени на неоднозначные ответы, сохраняя за человеком контроль над важными решениями. Пока это лишь ранняя проверка: поведение схемы при реальном внедрении и в нестандартных случаях не изучали.
Разбор
Авторы не просто сравнили оценки модели с человеческими, а встроили её в сценарий «человек остаётся в контуре». Модель получает короткий текст и выставляет баллы по уже существующей шкале: отдельно оценивает разные стороны ответа, а затем помогает решить, нужен ли полный разбор экспертом. Такой подход должен отсеивать очевидные случаи и оставлять специалисту ответы, где ошибка особенно дорого обойдётся — например, возле границы между уровнями подготовки или итоговыми результатами «сдал/не сдал».
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не опубликованная после рецензирования статья. Данные взяли из реального национального теста, но саму схему проверяли офлайн, без рабочего внедрения; кроме того, человеческие оценки, с которыми сравнивали ИИ, тоже могут различаться между проверяющими. Поэтому особенно важны будущие пилотные испытания и наблюдение за моделью со временем.
Пересказано ИИ по научной статье. Как это устроено