dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

ИИ лучше создаёт основу игры, чем ищет ошибки и проверяет изменения

0

Кратко

Авторы собрали набор проверок для трёх этапов работы ИИ над игрой: создания, исправления ошибок и постепенных изменений. В него вошли 97 заданий по созданию игр в 11 жанрах, 100 заданий на исправление ошибок и 17 длинных цепочек изменений. ИИ лучше справлялся с рабочей основой и ясными требованиями, чем с поиском скрытых проблем, проверкой работы игры и сохранением прежних возможностей после изменений.

Зачем это знать

Бенчмарк помогает увидеть, какие задачи в разработке игр агенты выполняют надёжнее, а где их результаты проверять сложнее. Но выводы основаны на специально созданных заданиях, а не на реальных коммерческих проектах.

Разбор

Авторы смотрели не только на готовую игру, но и на весь путь её создания агентом — от пустой папки до серии правок. Для этого они разделили проверку на три независимых трека. В первом агент получал один запрос и должен был собрать полноценную игру с нуля. Во втором ему сообщали о неисправностях — иногда прямо, а иногда оставляли их на самостоятельный поиск. В третьем агент получал цепочку запросов, чтобы проверить, умеет ли он улучшать проект постепенно, не ломая уже работающие части.

Проверка была разной для каждого этапа: исследователи запускали игру и взаимодействовали с ней, проводили одинаковые поведенческие тесты или оценивали итоговый продукт по заранее заданным критериям. Для проверки исправлений они специально добавляли в уровни ошибки, а затем просили агента их найти и устранить. Для длинных цепочек взяли последовательности запросов из реальных диалогов пользователей с агентами — это ближе к обычной работе, чем серия несвязанных искусственных команд.

Картина получилась неоднородной. Агентам легче выполнить явно сформулированное требование и собрать основу, с которой уже можно играть. Гораздо труднее заметить проблему без подсказки, убедиться, что исправление действительно работает во время запуска, и сохранить прежние возможности после нескольких изменений. Это объясняет, почему оценка только финального файла может быть слишком оптимистичной: внешне игра готова, но отдельные функции или старые исправления могли незаметно перестать работать.

Ключевые цифры

19–27 ошибокВ каждом проверочном уровне специально прятали много неисправностей, поэтому агенту нужно было не просто внести одну очевидную правку, а провести полноценную диагностику.
50 уровнейЗадания на исправление проверили на десятках игровых сцен, а не на одном-двух примерах.
6 ходовВ каждой цепочке улучшений агенту приходилось пережить несколько последовательных раундов правок — именно там особенно заметен риск сломать старые функции.
102 запросаТесты на постепенные изменения включали большой набор команд, связанных в длинные рабочие сценарии, а не только отдельные просьбы.

Можно ли доверять

Это препринт с arXiv, поэтому работу ещё не прошла независимая проверка рецензентами. При этом набор тестов довольно широкий, а 50 уровней для проверки исправлений исследователи подтвердили вручную; главное ограничение — результаты показывают поведение агентов на специально подготовленных бенчмарках, а не в настоящих коммерческих командах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас25 августа 2026 г.
Дата источника21 августа 2026 г.
ОригиналОткрыть
АвторыKun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng