Препринт — материал ещё не прошёл рецензирование
Новая версия коммерческой ИИ-модели улучшает одни задания, но ухудшает до 8,3% других
Кратко
Авторы 50 раз проверили 900 заданий трёх типов при трёх переходах между версиями одной линейки коммерческих моделей. Даже при общем росте результата до 7,3 процентного пункта отдельные задания стабильно ухудшались, а строгие требования к формату ответа заметно меняли картину.
Зачем это знать
Итоговый балл при замене модели может скрыть проблемы в отдельных заданиях и при строгих требованиях к формату ответа. Работа показывает это на публичных тестах, но не устанавливает, как часто такие регрессии возникают в реальных приложениях.
Разбор
Авторы не ограничились одним запуском каждой модели. Они взяли 900 отдельных заданий из трёх публичных тестов — на знания уровня магистратуры, олимпиадную математику и следование инструкциям — и отправили каждое задание каждой версии по 50 раз. Затем для каждого задания проверили, не объясняется ли разница случайными колебаниями ответов. Так они отделили устойчивые улучшения и ухудшения от случайных «скачков». Дополнительно исследователи сравнили результат с перестановочным тестом — проверкой, которая показывает, сколько различий могло бы появиться просто из-за шума выборки.
Главная находка за пределами общего балла: при шести переходах, где итоговая оценка выросла, от 4,4 до 8,3% заданий всё равно надёжно ухудшились. И наоборот, даже там, где общий результат упал, до 10,7% заданий заметно улучшились. Всего авторы нашли 457 устойчивых изменений на уровне отдельных заданий, которые невозможно было бы выявить по одному запуску каждой модели.
Отдельно они разобрали следование инструкциям в двух режимах. Строгий режим засчитывает ответ только при точном соблюдении формата, а мягкий допускает небольшие отклонения. На последнем переходе разница между этими режимами стала намного заметнее: падение в строгом режиме почти исчезало при мягкой проверке. Это важно для программ, которые автоматически разбирают ответы: лишний текст или неверный формат там действительно может сломать обработку, даже если сама мысль в ответе стала не хуже. Раньше похожие проверки проводили на открытых моделях или с меньшим числом повторов; эта работа переносит тот же подход на коммерческую линейку и публикует архив всех ответов и оценок по каждому заданию.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому его ещё не проверили рецензенты журнала. Сильная сторона — 50 повторов каждого задания, проверка против случайного шума и открытый архив ответов; но выводы получены на публичных тестах и трёх переходах одной коммерческой линейки, а не на реальных рабочих нагрузках.
Пересказано ИИ по научной статье. Как это устроено