Препринт — материал ещё не прошёл рецензирование
Промежуточные шаги помогают лучше управлять ответами моделей
Кратко
Авторы изучили четыре открытые модели рассуждений и нашли в их промежуточных шагах сигналы, которые предсказывают, проявит ли будущий ответ заданное поведение. Для этого они обучили простые пробные модели и получили точность 64–91% на шести бинарных задачах.
Зачем это знать
Это показывает, что внутри таких моделей могут быть не только признаки уже написанного текста, но и отдельные сигналы, связанные с будущим поведением. Метод перспективен для управления выводом моделей, но это preprint и результаты пока проверены только в ограниченном наборе моделей и задач.
Разбор
Авторы посмотрели не на финальный ответ модели, а на то, что происходит по ходу рассуждений — на промежуточные фразы, которые она генерирует шаг за шагом. Идея была простая: если модель уже на раннем этапе как-то «склоняется» к отказу, согласию, уязвимости к подсказке или другому поведению, это может быть видно раньше, чем ответ будет дописан до конца. Чтобы это проверить, они обучили простые пробные модели на скрытых активациях, то есть на внутренних числовых представлениях модели, которые обычный пользователь не видит.
Потом эти пробные модели научили угадывать, насколько вероятно нужное поведение в будущем ответе, и проверили это на шести задачах с двумя вариантами исхода. Получилось, что по промежуточным шагам можно предсказать будущий тип поведения с точностью от 64% до 91%. Это важный сдвиг по сравнению с более ранними попытками управлять моделью: раньше часто ориентировались на признаки уже написанного текста, а здесь нашли отдельные сигналы, которые связаны именно с будущим решением модели.
На этой основе авторы предложили способ управления генерацией на уровне текста. Он берет несколько вариантов следующего предложения и выбирает тот, где пробная модель считает нужное будущее поведение более вероятным. За счет этого удается вмешиваться в ответ мягче, чем при прямом воздействии на внутренние представления, и почти не портить качество текста. Еще один плюс: в некоторых проверках этот способ сработал там, где обычное вмешательство в активации не помогло. Но важно помнить, что всё это пока показано только на нескольких открытых reasoning-моделях и на ограниченном наборе задач из бенчмарков.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, так что работу еще не прошли обычную журнальную проверку. Авторы тестировали подход на четырех открытых моделях и шести бенчмарках, что неплохо для первого шага, но всё еще мало для уверенных выводов о всех reasoning-моделях. Особенно стоит иметь в виду, что оценка шла на ограниченном наборе задач и в режиме контролируемых тестов, а не в полном живом использовании.
Пересказано ИИ по научной статье. Как это устроено