dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Правильный ответ может быть во внутренних состояниях модели, но не попасть в выдачу

0

Кратко

Авторы проверили, сохраняется ли правильный ответ во внутренних состояниях языковых моделей, даже когда модель выдаёт ошибку. Простая поправка всего с двумя настройками, обученная примерно на 25 примерах без готовых ответов, повысила точность моделей Qwen3.5 на 9–34 процентных пункта и частично сработала на других моделях; контрольные модели Pythia почти не улучшились.

Зачем это знать

Результат подсказывает, что часть ошибок в тестах может отражать не отсутствие рассуждения, а сбой при превращении внутреннего решения в ответ. Это помогает осторожнее трактовать оценки ИИ, хотя работа проверяла лишь конкретные модели и задачи.

Разбор

Авторы разбирали ошибку поэтапно. Сначала проверяли скрытые состояния модели — набор чисел внутри сети, который появляется до финального ответа, — и выясняли, можно ли по ним восстановить правильный вариант. Затем смотрели, передаёт ли эта информация обычный выходной слой модели, то есть механизм, который превращает внутренние оценки в выбранный ответ. Наконец, они добавляли к этим оценкам небольшой сдвиг: модель не переобучали, а меняли только два параметра поверх уже полученных результатов.

Главная проблема в том, что модель может систематически завышать одни варианты ответа или неправильно распределять оценки между ними. Тогда внутренние признаки решения остаются, но финальный выбор ломается. Проверка на задачах по логике, ProofWriter, ANLI и FOLIO показала: для Qwen3.5 такая простая коррекция помогала не только на похожих примерах, но и на трудных задачах, где совпадение слов с известными шаблонами не объясняло успех. Исследователи также сравнили результат с перестановками, которые сохраняют общее число ответов каждого типа: коррекция оказалась лучше такого простого объяснения.

Картина была неодинаковой для всех моделей. В контролируемой задаче у Qwen3.5-9B точность выросла с 33,3% до 60,2%, а у Pythia-2.8B почти не изменилась. Это важно: метод не доказывает, что любая ошибка скрывает правильное рассуждение. Скорее, он предлагает дополнительную диагностику — сначала проверить внутренние состояния и работу выходного слоя, а уже потом заключать, что модель не умеет решать задачу.

Ключевые цифры

1000 примеровНа таком наборе проверяли, сохраняется ли эффект на множестве отдельных задач, а не на нескольких удачных случаях.
645 примеровЭто задачи, где простой поиск похожих слов не помогал; эффект на них показывает, что результат нельзя легко свести к поверхностному совпадению текста.
33,3% → 60,2%У Qwen3.5-9B в одной контролируемой задаче коррекция превратила примерно каждый третий правильный ответ в шесть правильных из десяти.
95% доверительный интервал: 57,1–63,3%Оценка точности Qwen3.5-9B находится примерно в этом диапазоне при учёте статистической неопределённости.

Можно ли доверять

Это препринт на arXiv, поэтому работу ещё не проверили рецензенты. Эксперименты выглядят содержательно: авторы использовали несколько наборов задач, контрольные модели и проверку на отдельных примерах, но выводы пока относятся к конкретным моделям и условиям, а не ко всем языковым моделям.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас1 сентября 2026 г.
Дата источника31 августа 2026 г.
ОригиналОткрыть
АвторыQiyao Yan, Chenpeng Wang, Liangming Pan