Препринт — материал ещё не прошёл рецензирование
При оценке ответов эталон важнее мощности ИИ
Кратко
В эксперименте шесть недорогих вариантов ИИ оценивали ответы на 24 открытых экзаменационных вопроса — всего 3456 оценок. Когда проверяющим давали правильный ответ и критерии, они работали не менее надёжно, чем гораздо более дорогие системы; личность проверяющего объясняла лишь 0,2% различий в оценках. Без правильного ответа надёжность резко падала: коэффициент согласованности оценок (ICC) снижался с 0,888 до 0,628.
Зачем это знать
Результат связывает надёжность оценивания прежде всего с качественно подготовленным эталонным ответом, а не с мощностью проверяющей модели. Но это наблюдение относится к 24 вопросам и конкретным конфигурациям ИИ в непрорецензированном препринте.
Разбор
Авторы проверили не только разные модели, но и саму схему работы any-to-bench. Сначала более мощная модель один раз разбирает экзамен: выделяет вопросы, официальный ответ и правила начисления баллов. Затем шесть более дешёвых конфигураций из двух семейств моделей, на трёх уровнях «усилий рассуждения», многократно проверяют ответы уже по этой заготовке. Такой подход должен перенести сложную работу на этап подготовки, чтобы массовая проверка не требовала дорогой модели каждый раз.
Оказалось, что основная разница в оценках связана не с тем, какая модель проверяет, а с тем, какой ответ ей попался: именно ответ объяснял 95,6% разброса баллов. Если увеличить усилия модели-автора ответа, его результат менялся заметно — до 0,143 от максимальной оценки. А увеличение усилий модели-проверяющего меняло выставленные баллы не более чем на 0,006. Шесть более мощных проверяющих подтвердили те же оценки и не дали более надёжного результата в составе группы.
Авторы отдельно разобрали, из чего состоит эталон. Если убрать из рубрики критерии и уровни, но оставить официальный ответ, измеримых изменений не произошло. А если убрать и официальный ответ, оценки стали выше, проверяющие начали сильнее расходиться, а качество рассуждения снова стало влиять на результат. Это показывает, что в такой схеме официальный ответ служит главным якорем, а критерии помогают оформить его в удобные правила. Также авторы не нашли признаков того, что модели завышают оценки длинным ответам или предпочитают ответы, созданные моделями из того же семейства.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv: другие учёные ещё не проверили работу рецензированием. Эксперимент охватывает 24 экзаменационных вопроса и конкретные конфигурации моделей, поэтому результат убедителен для этой схемы, но не доказывает, что она одинаково сработает для любых предметов и экзаменов.
Пересказано ИИ по научной статье. Как это устроено