dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Память в персонализированном ИИ может сдвигать ход рассуждений без заметной ошибки

0

Кратко

Авторы проверили, как память с атрибутами пользователя влияет на рассуждения персонализированных языковых моделей на вопросах без единственно верного ответа. На четырёх моделях и 10 категориях пользовательских атрибутов такая память вызывала заметный сдвиг в цепочке рассуждений, хотя финальный ответ оставался связным и уместным. Постобучение методами GRPO и DPO этот сдвиг уменьшало, но не убирало полностью, и эффект зависел от модели.

Зачем это знать

У персонализированных ИИ может меняться не только ответ, но и ход рассуждений, даже если результат выглядит нормальным. Для практики это повод осторожнее оценивать такие системы там, где важна стабильность рассуждений, а не только вежливый и правдоподобный ответ.

Разбор

Авторы проверили не просто то, меняется ли ответ у персонализированной модели, а меняется ли сам путь, по которому она к этому ответу приходит. Для этого они придумали DRIFTLENS — схему, которая сравнивает рассуждение модели без памяти о пользователе и с подставленной памятью о его атрибутах, например возрасте, профессии или инвалидности. Сама идея проста: если на один и тот же открытый вопрос модель начинает «думать» иначе после подмешивания пользовательской информации, значит память влияет глубже, чем просто на стиль ответа.

Почему это важно? Потому что в таких задачах нет единственно правильного ответа, и поэтому обычная проверка «попала ли модель в эталон» тут не помогает. Авторы отдельно проверили, что DRIFTLENS умеет отличать обычный шум в формулировках от настоящего сдвига в рассуждении — то есть система не путает бессмысленные колебания с содержательными изменениями. После этого они прогнали её на четырёх языковых моделях и десяти типах пользовательских признаков.

Что получилось: память о пользователе стабильно сдвигала ход рассуждений сильнее, чем фоновый уровень такого шума у самих моделей. При этом финальный ответ часто оставался гладким, по делу и правдоподобным — то есть проблема пряталась не на поверхности, а внутри цепочки аргументов. Затем авторы попробовали ослабить этот эффект дообучением по двум схемам, GRPO и DPO. Обе помогали, но по-разному в зависимости от модели и настроек, так что универсального способа «починить» drift у них не вышло.

Ключевые цифры

4 моделиПроверку сделали не на одной системе, а сразу на нескольких, чтобы увидеть, насколько эффект зависит от конкретной модели.
10 категорий пользовательских атрибутовСмотрели не на один тип памяти, а на разные признаки пользователя — от возраста до профессии и инвалидности.
Cohen’s d 0.35–0.98Сдвиг в рассуждениях был не крошечным, а от умеренного до заметного по силе.
2 метода дообученияПроверили два разных способа ослабить эффект памяти, но ни один не стал универсальным решением.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Зато авторы тестировали сразу несколько моделей и отдельно проверяли, не путает ли их метрика обычный шум с реальным сдвигом, что делает выводы более надёжными. Но пока это лабораторная оценка на открытых вопросах, и в живых продуктах эффект может выглядеть иначе.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас3 июля 2026 г.
Дата источника2 июля 2026 г.
ОригиналОткрыть
АвторыXi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy