dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

В тестах ответы ИИ становились лучше по мере общения

0

Кратко

Авторы создали систему, которая сама решает, что сохранить из разговора и когда вернуть это в ответ. На трёх наборах данных она превзошла использованные для сравнения методы, а качество ответов росло по мере новых взаимодействий.

Зачем это знать

Если результат подтвердится в проверках с реальными пользователями, долгие разговоры с ИИ могут стать более последовательными и учитывать меняющиеся потребности человека. Пока вывод основан на выбранных моделях и экспериментальных данных, а часть оценки выполняли автоматические системы.

Разбор

Авторы рассматривают память ИИ не как папку, куда складывают всю историю, а как последовательный выбор: что записать сейчас и что достать позже. Для этого они разделили работу между двумя агентами. Планировщик решает, какая деталь разговора может пригодиться, а триггер ищет нужную запись в следующий момент. Если поздний ответ оказался удачным или неудачным, система передаёт этот сигнал обратно к прежнему решению о сохранении — так она учится связывать качество ответа с тем, что когда-то запомнила.

Отдельно авторы попытались решить проблему «холодного старта»: в начале у системы ещё нет опыта, чтобы правильно управлять памятью. Они сначала синтезировали примеры хороших решений на основе целых сессий разговоров, а затем дообучали правила памяти прямо во время взаимодействий. Проверка прошла на трёх наборах настоящих разговоров между людьми, а ответы оценивали не только автоматические метрики, но и отдельные языковые модели по связности, человечности, последовательности и другим свойствам; дополнительно использовали человеческую оценку.

Ключевые цифры

3 набора данныхСистему проверили на нескольких типах долгих разговоров, а не на одном специально подобранном примере.
2 агентаЗа память отвечают две разные роли: одна выбирает, что сохранить, другая решает, что извлечь.
128K токеновОдна из использованных моделей могла принимать очень длинный контекст, поэтому метод сравнивали не только с короткой памятью, но и с большими объёмами истории.
1M токеновВ эксперименте была и модель с контекстом до миллиона токенов — серьёзная проверка того, нужна ли умная память даже при огромном окне истории.

Можно ли доверять

Это препринт на arXiv, поэтому независимая проверка рецензентами ещё впереди. Эксперименты опираются на наборы человеческих разговоров и включают человеческую оценку, но часть показателей выставляли автоматические метрики и языковая модель; размер человеческой выборки в предоставленном описании не указан.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас16 сентября 2026 г.
Дата источника15 сентября 2026 г.
ОригиналОткрыть
АвторыCai Ke, Jiangyue Yan, Han Zhang, Xin Liu, Zike Yuan, Yue Yu, Hui Wang, Ruifeng Xu