Препринт — материал ещё не прошёл рецензирование
ИИ лучше создаёт основу игры, чем ищет ошибки и проверяет изменения
Кратко
Авторы собрали набор проверок для трёх этапов работы ИИ над игрой: создания, исправления ошибок и постепенных изменений. В него вошли 97 заданий по созданию игр в 11 жанрах, 100 заданий на исправление ошибок и 17 длинных цепочек изменений. ИИ лучше справлялся с рабочей основой и ясными требованиями, чем с поиском скрытых проблем, проверкой работы игры и сохранением прежних возможностей после изменений.
Зачем это знать
Бенчмарк помогает увидеть, какие задачи в разработке игр агенты выполняют надёжнее, а где их результаты проверять сложнее. Но выводы основаны на специально созданных заданиях, а не на реальных коммерческих проектах.
Разбор
Авторы смотрели не только на готовую игру, но и на весь путь её создания агентом — от пустой папки до серии правок. Для этого они разделили проверку на три независимых трека. В первом агент получал один запрос и должен был собрать полноценную игру с нуля. Во втором ему сообщали о неисправностях — иногда прямо, а иногда оставляли их на самостоятельный поиск. В третьем агент получал цепочку запросов, чтобы проверить, умеет ли он улучшать проект постепенно, не ломая уже работающие части.
Проверка была разной для каждого этапа: исследователи запускали игру и взаимодействовали с ней, проводили одинаковые поведенческие тесты или оценивали итоговый продукт по заранее заданным критериям. Для проверки исправлений они специально добавляли в уровни ошибки, а затем просили агента их найти и устранить. Для длинных цепочек взяли последовательности запросов из реальных диалогов пользователей с агентами — это ближе к обычной работе, чем серия несвязанных искусственных команд.
Картина получилась неоднородной. Агентам легче выполнить явно сформулированное требование и собрать основу, с которой уже можно играть. Гораздо труднее заметить проблему без подсказки, убедиться, что исправление действительно работает во время запуска, и сохранить прежние возможности после нескольких изменений. Это объясняет, почему оценка только финального файла может быть слишком оптимистичной: внешне игра готова, но отдельные функции или старые исправления могли незаметно перестать работать.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому работу ещё не прошла независимая проверка рецензентами. При этом набор тестов довольно широкий, а 50 уровней для проверки исправлений исследователи подтвердили вручную; главное ограничение — результаты показывают поведение агентов на специально подготовленных бенчмарках, а не в настоящих коммерческих командах.
Пересказано ИИ по научной статье. Как это устроено