dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Проверка ответов ИИ зависит от формулировок

0

Кратко

В preprint для задач с выбором ответа авторы показывают, что стандартные оценки сильно зависят от того, как именно сформулированы варианты. В контролируемых экспериментах на моделях с одинаковыми знаниями это создавало ложный разрыв в результатах, а ParaEval уменьшал его за счёт нескольких перефразировок каждого ответа.

Зачем это знать

Это важно для оценки моделей: высокий балл не всегда означает более глубокие знания, если метрика чувствительна к словам и формулировкам. Работа скорее помогает точнее сравнивать модели, чем даёт прямой практический совет для пользователей.

Разбор

Авторы взяли привычные тесты с выбором ответа и посмотрели на очень приземлённую, но важную вещь: не ломается ли оценка, если один и тот же смысл записать чуть по-разному. Оказалось, что ломается. В таких тестах модель обычно сравнивает варианты по тому, насколько вероятной ей кажется конкретная последовательность слов, и из-за этого она может лучше «узнавать» одну формулировку, чем другую, даже если смысл ей известен.

Чтобы проверить, насколько сильна эта проблема, они собрали контролируемую площадку: модели с одним и тем же набором знаний, но разных размеров. Это помогает отделить реальное знание от эффекта удачной или неудачной формулировки. На такой проверке стандартная метрика показывала разницу больше чем в 2 пункта там, где в реальности разницы быть не должно было. То есть сама система оценки рисовала ложный разрыв между моделями.

Дальше авторы предложили ParaEval: для каждого варианта ответа они не оставляют одну-единственную фразу, а пробуют несколько перефразировок и берут самую удачную для модели. Смысл тут не в том, чтобы подстроиться под модель, а в том, чтобы не наказывать её за совпадение или несовпадение с одной конкретной формулировкой. Когда так делают, ложный разрыв уменьшается до меньше чем 1 пункта. Причём эффект сохранился не только на небольших моделях, но и на крупных открытых моделях на 70 и 120 миллиардов параметров — то есть это не мелкий сбой на одной узкой проверке, а более общий перекос в привычной схеме оценки.

Ключевые цифры

1B-8BЭффект проверили не на одной игрушечной модели, а на нескольких моделях разного масштаба — от сравнительно небольших до уже серьёзных по размеру.
2 pointsОбычная оценка могла нарисовать заметную разницу между моделями даже там, где они на самом деле знали одно и то же.
1 pointПосле ParaEval ложный разрыв почти исчезает, то есть оценка становится гораздо ближе к реальной картине.
70B и 120BПроблема осталась видна и на очень крупных открытых моделях, так что это не ограничивается маленькими системами.

Можно ли доверять

Это preprint на arXiv, значит работу ещё не проверили рецензенты. Сильная сторона — контролируемый тест с моделями, у которых одинаковые знания, поэтому авторы довольно чисто отделили эффект формулировки от реального качества. Но это всё же проверка в рамках benchmark-задач, а не в живом использовании, так что для полной уверенности нужен ещё внешний повтор на других наборах вопросов.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас10 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыJoão Maria Janeiro, Mathurin Videau, Andrea Caciolai, Benjamin Piwowarski, Patrick Gallinari, Loic Barrault