Препринт — материал ещё не прошёл рецензирование
Временные предпочтения ИИ можно заметно сдвигать
Кратко
В Qwen3-32B нашли направление, связанное с выбором между кратким и длинным горизонтом. Если добавить его в работу модели, она начинает чаще тянуться либо к более ранней, либо к более поздней награде; на денежной задаче это сильно меняло порог безразличия между ними.
Зачем это знать
Это показывает, что такие предпочтения у языковой модели можно измерять и целенаправленно двигать. Пока результат получен только на одной модели и в искусственных тестах, поэтому его стоит рассматривать как ранний сигнал, а не готовый инструмент.
Разбор
Исследователи не просто смотрели, как модель отвечает на вопросы про время, а пытались найти внутри неё отдельное «направление» — то есть такой участок внутреннего представления, который связан с выбором между более быстрым и более долгим вариантом. Для этого они обучили простые линейные датчики на ответах модели в режиме teacher forcing: по сути, давали модели правильные ответы и искали, какой внутренний сигнал лучше всего различает короткий и длинный горизонт.
Потом этот найденный сигнал не только проверили на той же задаче, но и «подмешали» в работу модели во время ответа. Так можно сдвигать поведение в нужную сторону: делать модель более нетерпеливой или, наоборот, более ориентированной на долгую перспективу. Самое интересное тут в том, что эффект вышел двусторонним и довольно сильным: направление, найденное на простой бинарной задаче, переносилось на денежный выбор с разными суммами и задержками, хотя сама денежная задача в обучении не участвовала.
Ещё один важный кусок — проверка на задаче про планирование поездки. При умеренном сдвиге во времени модель там даже улучшала результат по метрике способности к планированию. Авторы также сравнили свой подход со случайным контролем: случайное направление не давало такого же устойчивого и согласованного эффекта, так что это не похоже на шумовую удачу.
В итоге статья показывает не просто «модель иногда отвечает по-разному», а что её временные предпочтения можно измерить как отдельную структуру и довольно точно двигать. Это важно для систем, которые дают советы про отсроченные выгоды и потери, а ещё для оценки того, как языковые модели ведут себя на длинных горизонтах.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Сильная сторона в том, что авторы проверили эффект не только на одной внутренней задаче, но и на отдельном денежном тесте и на бенчмарке планирования; слабое место — всё это всё ещё тесты на одной модели, без реального применения к людям или живым решениям.
Пересказано ИИ по научной статье. Как это устроено