Препринт — материал ещё не прошёл рецензирование
ℓ2-норма скрытых состояний помогает отслеживать ход рассуждений
Кратко
В препринте на нескольких LLM и бенчмарках для рассуждений авторы связывают всплески ℓ2-нормы скрытых состояний с моментами, где модель решает более сложные шаги. На этой основе они предлагают тестовые вмешательства без дообучения и сообщают о росте качества на проверенных задачах.
Зачем это знать
Это предварительный сигнал о том, что ℓ2-норма может быть полезна как индикатор внутренней динамики LLM. Но пока речь идёт о препринте и о результатах на конкретных бенчмарках, поэтому выводы стоит воспринимать осторожно.
Разбор
Авторы посмотрели не на ответы модели, а внутрь неё: на то, как меняется длина скрытых состояний — внутренних векторов, через которые LLM обрабатывает информацию по слоям. Идея была простая: если в какой-то момент модель действительно «включается» на сложный шаг рассуждения, это должно как-то отражаться в её внутренней активности. Для этого они использовали sparse autoencoders — это такой диагностический инструмент, который помогает вытащить из скрытых состояний отдельные признаки и увидеть, какие из них вспыхивают сильнее всего.
Самый заметный результат: всплески ℓ2-нормы скрытых состояний чаще всего приходятся на поздние слои и совпадают с моментами, где модель решает более трудные части задачи. То есть рост этой нормы оказался не случайным шумом, а сигналом о том, что модель дошла до важного шага в рассуждении. Авторы не ограничились только корреляцией: они ещё и делали вмешательства в процессе вывода и проверяли, меняется ли поведение модели. Это помогло показать, что ℓ2-норма действительно связана с внутренней динамикой рассуждения, а не просто красиво совпадает на графиках.
На этой основе они предложили три способа управлять ответом прямо во время работы модели, без дообучения и без дополнительных данных. Один метод заставляет модель по-новому распределять вычисления по слоям, другой подталкивает её внутреннее состояние в нужную сторону, третий выбирает лучший ответ среди нескольких вариантов, опираясь на ℓ2-норму. Важный контекст здесь такой: раньше улучшение рассуждений чаще строили либо на длинных цепочках рассуждений в самом ответе, либо на более сложных архитектурных трюках. Здесь же авторы пытаются использовать уже имеющийся внутренний сигнал модели, чтобы управлять её рассуждением проще и дешевле.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли обычную внешнюю проверку рецензентов. Проверяли методы на нескольких моделях и бенчмарках, так что сигнал выглядит не случайным, но результаты пока относятся к конкретным тестам, а не ко всем LLM в реальном использовании. Также авторы сами показывают, что речь идёт именно о тестовом вмешательстве без обучения, поэтому эффект стоит рассматривать как перспективный, но предварительный.
Пересказано ИИ по научной статье. Как это устроено