Препринт — материал ещё не прошёл рецензирование
Повторные циклы помогли ИИ-кодировщикам улучшать программы на трёх тестах
Кратко
Авторы создали систему, которая разбивает работу над программой на небольшие циклы: планирование, написание и проверку. На трёх тестах она в среднем дала результат на 52,25% лучше исходных инструментов, а максимальный прирост после трёх циклов составил 82,86%. В отдельном запуске длиной более 70 циклов система самостоятельно создала игру-боевик от первого лица с сюжетом, игровыми правилами, графикой и звуком.
Зачем это знать
Работа служит ранней проверкой того, как ИИ может долго развивать сложную программу с минимальным участием человека. Это препринт, а вывод опирается всего на три теста и одну демонстрацию, поэтому пока неясно, будет ли такой результат стабильно повторяться в обычной разработке.
Разбор
Авторы не стали обучать новую модель с нуля. Они взяли уже существующие инструменты для ИИ-разработчиков и добавили над ними отдельный управляющий слой — Harness-of-Harness. Он заставляет агента работать короткими проверяемыми шагами: сначала выбрать небольшой фрагмент работы, затем написать код, проверить его и решить, что чинить или развивать дальше. При этом система хранит версии проекта и постепенно открывает агенту нужные инструменты и материалы, чтобы тот мог переиспользовать уже сделанное, а не собирать всё заново.
Главная проблема здесь — не разовая генерация кода, а длительная разработка. После нескольких удачных команд агент может начать ломать рабочие части программы, поэтому HoH отдельно разделяет проверку во время написания кода и независимую оценку результата. Такой подход позволяет не только исправлять ошибки, но и добавлять новые возможности небольшими порциями. Авторы сравнили три связки готового инструмента и модели: Codex с GPT-5.5, OpenCode с DeepSeek-V4-Pro и Pi с MiniMax-M3. Во всех трёх случаях надстройка оказалась сильнее соответствующего инструмента без неё.
В многодневном запуске система продолжала работу без постоянного вмешательства человека и постепенно собрала игру от первого лица. В абстракте отдельно отмечено, что итоговая версия содержала не только код: в ней были связный сюжет, основные игровые правила, пригодный для человека игровой процесс, улучшенная графика и встроенный звук. Это показывает не просто способность исправлять отдельные функции, а попытку поддерживать целостность большого проекта на протяжении долгой серии изменений.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не прошла обычная журнальная проверка другими учёными. Результаты выглядят содержательно, но их проверили на трёх тестах и трёх связках инструментов с моделями, а длительная демонстрация игры — это один отдельный запуск; по абстракту нельзя понять, насколько стабильно такой процесс повторится на других проектах.
Пересказано ИИ по научной статье. Как это устроено