dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Новая версия коммерческой ИИ-модели улучшает одни задания, но ухудшает до 8,3% других

0

Кратко

Авторы 50 раз проверили 900 заданий трёх типов при трёх переходах между версиями одной линейки коммерческих моделей. Даже при общем росте результата до 7,3 процентного пункта отдельные задания стабильно ухудшались, а строгие требования к формату ответа заметно меняли картину.

Зачем это знать

Итоговый балл при замене модели может скрыть проблемы в отдельных заданиях и при строгих требованиях к формату ответа. Работа показывает это на публичных тестах, но не устанавливает, как часто такие регрессии возникают в реальных приложениях.

Разбор

Авторы не ограничились одним запуском каждой модели. Они взяли 900 отдельных заданий из трёх публичных тестов — на знания уровня магистратуры, олимпиадную математику и следование инструкциям — и отправили каждое задание каждой версии по 50 раз. Затем для каждого задания проверили, не объясняется ли разница случайными колебаниями ответов. Так они отделили устойчивые улучшения и ухудшения от случайных «скачков». Дополнительно исследователи сравнили результат с перестановочным тестом — проверкой, которая показывает, сколько различий могло бы появиться просто из-за шума выборки.

Главная находка за пределами общего балла: при шести переходах, где итоговая оценка выросла, от 4,4 до 8,3% заданий всё равно надёжно ухудшились. И наоборот, даже там, где общий результат упал, до 10,7% заданий заметно улучшились. Всего авторы нашли 457 устойчивых изменений на уровне отдельных заданий, которые невозможно было бы выявить по одному запуску каждой модели.

Отдельно они разобрали следование инструкциям в двух режимах. Строгий режим засчитывает ответ только при точном соблюдении формата, а мягкий допускает небольшие отклонения. На последнем переходе разница между этими режимами стала намного заметнее: падение в строгом режиме почти исчезало при мягкой проверке. Это важно для программ, которые автоматически разбирают ответы: лишний текст или неверный формат там действительно может сломать обработку, даже если сама мысль в ответе стала не хуже. Раньше похожие проверки проводили на открытых моделях или с меньшим числом повторов; эта работа переносит тот же подход на коммерческую линейку и публикует архив всех ответов и оценок по каждому заданию.

Ключевые цифры

900 заданийЭто не одна итоговая оценка, а подробная проверка по множеству отдельных случаев из трёх разных типов тестов.
50 запусков на заданиеПовторные ответы помогают отличить устойчивое изменение модели от случайного удачного или неудачного ответа.
457 устойчивых измененийСтолько улучшений и ухудшений на уровне отдельных заданий обнаружили во всех девяти сочетаниях перехода и теста; один запуск их не показал бы.
3,9 процентного пунктаНа последнем переходе настолько увеличилась разница между строгой и мягкой проверкой формата в тесте на выполнение инструкций.

Можно ли доверять

Это препринт на arXiv, поэтому его ещё не проверили рецензенты журнала. Сильная сторона — 50 повторов каждого задания, проверка против случайного шума и открытый архив ответов; но выводы получены на публичных тестах и трёх переходах одной коммерческой линейки, а не на реальных рабочих нагрузках.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас19 августа 2026 г.
Дата источника18 августа 2026 г.
ОригиналОткрыть
АвторыXiaonan Xu, Wenjing Wu