Препринт — материал ещё не прошёл рецензирование
Память в персонализированном ИИ может сдвигать ход рассуждений без заметной ошибки
Кратко
Авторы проверили, как память с атрибутами пользователя влияет на рассуждения персонализированных языковых моделей на вопросах без единственно верного ответа. На четырёх моделях и 10 категориях пользовательских атрибутов такая память вызывала заметный сдвиг в цепочке рассуждений, хотя финальный ответ оставался связным и уместным. Постобучение методами GRPO и DPO этот сдвиг уменьшало, но не убирало полностью, и эффект зависел от модели.
Зачем это знать
У персонализированных ИИ может меняться не только ответ, но и ход рассуждений, даже если результат выглядит нормальным. Для практики это повод осторожнее оценивать такие системы там, где важна стабильность рассуждений, а не только вежливый и правдоподобный ответ.
Разбор
Авторы проверили не просто то, меняется ли ответ у персонализированной модели, а меняется ли сам путь, по которому она к этому ответу приходит. Для этого они придумали DRIFTLENS — схему, которая сравнивает рассуждение модели без памяти о пользователе и с подставленной памятью о его атрибутах, например возрасте, профессии или инвалидности. Сама идея проста: если на один и тот же открытый вопрос модель начинает «думать» иначе после подмешивания пользовательской информации, значит память влияет глубже, чем просто на стиль ответа.
Почему это важно? Потому что в таких задачах нет единственно правильного ответа, и поэтому обычная проверка «попала ли модель в эталон» тут не помогает. Авторы отдельно проверили, что DRIFTLENS умеет отличать обычный шум в формулировках от настоящего сдвига в рассуждении — то есть система не путает бессмысленные колебания с содержательными изменениями. После этого они прогнали её на четырёх языковых моделях и десяти типах пользовательских признаков.
Что получилось: память о пользователе стабильно сдвигала ход рассуждений сильнее, чем фоновый уровень такого шума у самих моделей. При этом финальный ответ часто оставался гладким, по делу и правдоподобным — то есть проблема пряталась не на поверхности, а внутри цепочки аргументов. Затем авторы попробовали ослабить этот эффект дообучением по двум схемам, GRPO и DPO. Обе помогали, но по-разному в зависимости от модели и настроек, так что универсального способа «починить» drift у них не вышло.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Зато авторы тестировали сразу несколько моделей и отдельно проверяли, не путает ли их метрика обычный шум с реальным сдвигом, что делает выводы более надёжными. Но пока это лабораторная оценка на открытых вопросах, и в живых продуктах эффект может выглядеть иначе.
Пересказано ИИ по научной статье. Как это устроено