Препринт — материал ещё не прошёл рецензирование
Правильный ответ может быть во внутренних состояниях модели, но не попасть в выдачу
Кратко
Авторы проверили, сохраняется ли правильный ответ во внутренних состояниях языковых моделей, даже когда модель выдаёт ошибку. Простая поправка всего с двумя настройками, обученная примерно на 25 примерах без готовых ответов, повысила точность моделей Qwen3.5 на 9–34 процентных пункта и частично сработала на других моделях; контрольные модели Pythia почти не улучшились.
Зачем это знать
Результат подсказывает, что часть ошибок в тестах может отражать не отсутствие рассуждения, а сбой при превращении внутреннего решения в ответ. Это помогает осторожнее трактовать оценки ИИ, хотя работа проверяла лишь конкретные модели и задачи.
Разбор
Авторы разбирали ошибку поэтапно. Сначала проверяли скрытые состояния модели — набор чисел внутри сети, который появляется до финального ответа, — и выясняли, можно ли по ним восстановить правильный вариант. Затем смотрели, передаёт ли эта информация обычный выходной слой модели, то есть механизм, который превращает внутренние оценки в выбранный ответ. Наконец, они добавляли к этим оценкам небольшой сдвиг: модель не переобучали, а меняли только два параметра поверх уже полученных результатов.
Главная проблема в том, что модель может систематически завышать одни варианты ответа или неправильно распределять оценки между ними. Тогда внутренние признаки решения остаются, но финальный выбор ломается. Проверка на задачах по логике, ProofWriter, ANLI и FOLIO показала: для Qwen3.5 такая простая коррекция помогала не только на похожих примерах, но и на трудных задачах, где совпадение слов с известными шаблонами не объясняло успех. Исследователи также сравнили результат с перестановками, которые сохраняют общее число ответов каждого типа: коррекция оказалась лучше такого простого объяснения.
Картина была неодинаковой для всех моделей. В контролируемой задаче у Qwen3.5-9B точность выросла с 33,3% до 60,2%, а у Pythia-2.8B почти не изменилась. Это важно: метод не доказывает, что любая ошибка скрывает правильное рассуждение. Скорее, он предлагает дополнительную диагностику — сначала проверить внутренние состояния и работу выходного слоя, а уже потом заключать, что модель не умеет решать задачу.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому работу ещё не проверили рецензенты. Эксперименты выглядят содержательно: авторы использовали несколько наборов задач, контрольные модели и проверку на отдельных примерах, но выводы пока относятся к конкретным моделям и условиям, а не ко всем языковым моделям.
Пересказано ИИ по научной статье. Как это устроено