dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

В симуляциях CURB ослабил сговор ИИ-агентов

0

Кратко

В компьютерных симуляциях ценовой и количественной конкуренции метод CURB снизил сговор между обучающимися ИИ-агентами. Он ослабляет их способность удерживать договорённости угрозами наказания за отклонение и сработал также для агентов с нейронными сетями.

Зачем это знать

Если результат подтвердится в других сценариях, CURB может стать основой для проверки и ослабления сговора алгоритмов, даже когда их никто специально не программировал договариваться. Пока это результат препринта, полученный только в симуляциях, а не на реальных рынках.

Разбор

Авторы сначала связали наблюдаемое поведение агентов с классической моделью наказаний: агент поддерживает выгодный для всех сговор, потому что после отклонения ожидает ответного наказания. Затем они измеряли, насколько меняется распределение действий агента после «кооперативной» и после «нарушающей» истории. Для этого использовали расстояние полной вариации — показатель от 0 до 1, который показывает, насколько различаются два набора вероятностей действий. CURB штрафует такую зависимость в процессе обучения, а ещё подбрасывает агенту искусственные примеры: он отклоняется от договорённости, но соперник не мстит, и агент получает соответствующую прибыль. Так алгоритм учится не считать угрозу наказания обязательной частью стратегии.

Ключевые цифры

15 действийВ базовом эксперименте с ценами у каждого агента был не непрерывный выбор, а сетка из 15 возможных цен.
λ = 0,2При такой силе штрафа в проверке с ценами сговор уже приближался к конкурентному уровню; меньший штраф 0,05 почти не отличался от отсутствия вмешательства.
2 компонентаРабочая версия CURB объединила штраф за зависимость действий от истории и искусственные примеры отклонения: по отдельности они работали заметно слабее.

Можно ли доверять

Это препринт arXiv, поэтому независимую проверку экспертов он ещё не прошёл. Результат получили в компьютерных повторяющихся играх с двумя типами конкуренции и двумя видами обучающихся агентов, а не на реальных рынках; кроме того, вывод зависит от выбранного правила, по которому алгоритм помечает действие как отклонение.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас18 сентября 2026 г.
Дата источника17 сентября 2026 г.
ОригиналОткрыть
АвторыKarthik Sivachandran, Rohan Paleja