Препринт — материал ещё не прошёл рецензирование
Проверка ответов ИИ зависит от формулировок
Кратко
В preprint для задач с выбором ответа авторы показывают, что стандартные оценки сильно зависят от того, как именно сформулированы варианты. В контролируемых экспериментах на моделях с одинаковыми знаниями это создавало ложный разрыв в результатах, а ParaEval уменьшал его за счёт нескольких перефразировок каждого ответа.
Зачем это знать
Это важно для оценки моделей: высокий балл не всегда означает более глубокие знания, если метрика чувствительна к словам и формулировкам. Работа скорее помогает точнее сравнивать модели, чем даёт прямой практический совет для пользователей.
Разбор
Авторы взяли привычные тесты с выбором ответа и посмотрели на очень приземлённую, но важную вещь: не ломается ли оценка, если один и тот же смысл записать чуть по-разному. Оказалось, что ломается. В таких тестах модель обычно сравнивает варианты по тому, насколько вероятной ей кажется конкретная последовательность слов, и из-за этого она может лучше «узнавать» одну формулировку, чем другую, даже если смысл ей известен.
Чтобы проверить, насколько сильна эта проблема, они собрали контролируемую площадку: модели с одним и тем же набором знаний, но разных размеров. Это помогает отделить реальное знание от эффекта удачной или неудачной формулировки. На такой проверке стандартная метрика показывала разницу больше чем в 2 пункта там, где в реальности разницы быть не должно было. То есть сама система оценки рисовала ложный разрыв между моделями.
Дальше авторы предложили ParaEval: для каждого варианта ответа они не оставляют одну-единственную фразу, а пробуют несколько перефразировок и берут самую удачную для модели. Смысл тут не в том, чтобы подстроиться под модель, а в том, чтобы не наказывать её за совпадение или несовпадение с одной конкретной формулировкой. Когда так делают, ложный разрыв уменьшается до меньше чем 1 пункта. Причём эффект сохранился не только на небольших моделях, но и на крупных открытых моделях на 70 и 120 миллиардов параметров — то есть это не мелкий сбой на одной узкой проверке, а более общий перекос в привычной схеме оценки.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, значит работу ещё не проверили рецензенты. Сильная сторона — контролируемый тест с моделями, у которых одинаковые знания, поэтому авторы довольно чисто отделили эффект формулировки от реального качества. Но это всё же проверка в рамках benchmark-задач, а не в живом использовании, так что для полной уверенности нужен ещё внешний повтор на других наборах вопросов.
Пересказано ИИ по научной статье. Как это устроено