dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ℓ2-норма скрытых состояний помогает отслеживать ход рассуждений

0

Кратко

В препринте на нескольких LLM и бенчмарках для рассуждений авторы связывают всплески ℓ2-нормы скрытых состояний с моментами, где модель решает более сложные шаги. На этой основе они предлагают тестовые вмешательства без дообучения и сообщают о росте качества на проверенных задачах.

Зачем это знать

Это предварительный сигнал о том, что ℓ2-норма может быть полезна как индикатор внутренней динамики LLM. Но пока речь идёт о препринте и о результатах на конкретных бенчмарках, поэтому выводы стоит воспринимать осторожно.

Разбор

Авторы посмотрели не на ответы модели, а внутрь неё: на то, как меняется длина скрытых состояний — внутренних векторов, через которые LLM обрабатывает информацию по слоям. Идея была простая: если в какой-то момент модель действительно «включается» на сложный шаг рассуждения, это должно как-то отражаться в её внутренней активности. Для этого они использовали sparse autoencoders — это такой диагностический инструмент, который помогает вытащить из скрытых состояний отдельные признаки и увидеть, какие из них вспыхивают сильнее всего.

Самый заметный результат: всплески ℓ2-нормы скрытых состояний чаще всего приходятся на поздние слои и совпадают с моментами, где модель решает более трудные части задачи. То есть рост этой нормы оказался не случайным шумом, а сигналом о том, что модель дошла до важного шага в рассуждении. Авторы не ограничились только корреляцией: они ещё и делали вмешательства в процессе вывода и проверяли, меняется ли поведение модели. Это помогло показать, что ℓ2-норма действительно связана с внутренней динамикой рассуждения, а не просто красиво совпадает на графиках.

На этой основе они предложили три способа управлять ответом прямо во время работы модели, без дообучения и без дополнительных данных. Один метод заставляет модель по-новому распределять вычисления по слоям, другой подталкивает её внутреннее состояние в нужную сторону, третий выбирает лучший ответ среди нескольких вариантов, опираясь на ℓ2-норму. Важный контекст здесь такой: раньше улучшение рассуждений чаще строили либо на длинных цепочках рассуждений в самом ответе, либо на более сложных архитектурных трюках. Здесь же авторы пытаются использовать уже имеющийся внутренний сигнал модели, чтобы управлять её рассуждением проще и дешевле.

Ключевые цифры

4.51%В среднем предложенные методы дали заметный, но не огромный прирост качества на наборе проверенных задач.
9.13%На самых трудных задачах по рассуждению улучшение оказалось ещё сильнее, чем в среднем.
3Авторы предложили три разных способа использовать внутренний сигнал модели во время ответа.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не прошли обычную внешнюю проверку рецензентов. Проверяли методы на нескольких моделях и бенчмарках, так что сигнал выглядит не случайным, но результаты пока относятся к конкретным тестам, а не ко всем LLM в реальном использовании. Также авторы сами показывают, что речь идёт именно о тестовом вмешательстве без обучения, поэтому эффект стоит рассматривать как перспективный, но предварительный.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас7 июня 2026 г.
Дата источника4 июня 2026 г.
ОригиналОткрыть
АвторыJinyang Zhang, Hongxin Ding, Yue Fang, Weibin Liao, Muyang Ye, Junfeng Zhao, Yasha Wang