dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Симуляция долгой жизни помогла ИИ лучше проходить ролевые бенчмарки

0

Кратко

В работе проверили долгую симуляцию общества с 100 агентами в трёх мирах на 10 виртуальных лет. Авторы определили life reward как прокси благополучия и использовали его для обучения LLM через rejection sampling, а затем оценили модель на бенчмарках ролевого поведения.

Зачем это знать

Это показывает, что социальный опыт в симуляции может улучшать поведение языковой модели в ролевых бенчмарках. Но результаты относятся к preprint, к искусственной среде и не переносятся напрямую на реальное человеческое поведение.

Разбор

Авторы не просто «покормили» модель ещё одним набором текстов, а устроили для неё длинную виртуальную жизнь. Они собрали среду, где 100 агентов живут сами по себе: строят отношения, решают бытовые и социальные задачи, пытаются чего-то добиться и при этом существуют не несколько дней, а целых 10 виртуальных лет. Это важно, потому что раньше такие симуляции обычно были короткими — на уровне дней — и не успевали показать, как в обществе накапливается опыт.

Чтобы понять, что считать успешной жизнью в такой среде, исследователи ввели life reward — простую оценку благополучия агента. По сути, это попытка измерить не только «выжил или нет», а насколько жизнь в симуляции складывается удачно: есть ли признание со стороны других, чувство удовлетворённости и экономический успех. Затем они использовали эту оценку для обучения языковой модели через rejection sampling — метод, где из множества вариантов выбирают более удачные примеры и по ним подстраивают модель.

Самый интересный результат в том, что после такого обучения модель стала лучше не только внутри симуляции, но и на внешних ролевых тестах. Особенно выросли навыки, связанные с «человечностью» поведения: точнее передавать манеру роли, лучше держаться в образе и выглядеть более антропоморфной. То есть длинная социальная жизнь в искусственном мире дала модели не просто новые факты, а более естественный стиль поведения в ролевых сценариях.

Ключевые цифры

100 агентовВ одной виртуальной среде одновременно жили и взаимодействовали сразу сто персонажей — это уже похоже не на тест, а на маленькое общество.
10 виртуальных летМодель учили на очень длинном опыте: не на коротком эпизоде, а на жизни, которая в симуляции растянулась на годы.
+15.6%После обучения на жизненном опыте модель заметно лучше справилась с ролевыми заданиями по сравнению с исходным вариантом.
+23.7%Сильнее всего улучшилось умение звучать по-человечески, а не как сухой генератор текста.

Можно ли доверять

Это preprint на arXiv, значит, работу ещё не проверяли независимые рецензенты. При этом авторы прогнали модель в нескольких мирах и на ролевых бенчмарках, так что это не одиночный случайный тест. Но всё происходило в искусственной среде с виртуальными агентами, поэтому переносить выводы напрямую на реальных людей нельзя.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас8 июня 2026 г.
Дата источника5 июня 2026 г.
ОригиналОткрыть
АвторыXintao Wang, Sirui Zheng, Hongqiu Wu, Weiyuan Li, Jen-tse Huang, Minghao Zhu, Can Zu, Qi Deng, Jiawei Wang, Qianyu He