dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Повторные циклы помогли ИИ-кодировщикам улучшать программы на трёх тестах

0

Кратко

Авторы создали систему, которая разбивает работу над программой на небольшие циклы: планирование, написание и проверку. На трёх тестах она в среднем дала результат на 52,25% лучше исходных инструментов, а максимальный прирост после трёх циклов составил 82,86%. В отдельном запуске длиной более 70 циклов система самостоятельно создала игру-боевик от первого лица с сюжетом, игровыми правилами, графикой и звуком.

Зачем это знать

Работа служит ранней проверкой того, как ИИ может долго развивать сложную программу с минимальным участием человека. Это препринт, а вывод опирается всего на три теста и одну демонстрацию, поэтому пока неясно, будет ли такой результат стабильно повторяться в обычной разработке.

Разбор

Авторы не стали обучать новую модель с нуля. Они взяли уже существующие инструменты для ИИ-разработчиков и добавили над ними отдельный управляющий слой — Harness-of-Harness. Он заставляет агента работать короткими проверяемыми шагами: сначала выбрать небольшой фрагмент работы, затем написать код, проверить его и решить, что чинить или развивать дальше. При этом система хранит версии проекта и постепенно открывает агенту нужные инструменты и материалы, чтобы тот мог переиспользовать уже сделанное, а не собирать всё заново.

Главная проблема здесь — не разовая генерация кода, а длительная разработка. После нескольких удачных команд агент может начать ломать рабочие части программы, поэтому HoH отдельно разделяет проверку во время написания кода и независимую оценку результата. Такой подход позволяет не только исправлять ошибки, но и добавлять новые возможности небольшими порциями. Авторы сравнили три связки готового инструмента и модели: Codex с GPT-5.5, OpenCode с DeepSeek-V4-Pro и Pi с MiniMax-M3. Во всех трёх случаях надстройка оказалась сильнее соответствующего инструмента без неё.

В многодневном запуске система продолжала работу без постоянного вмешательства человека и постепенно собрала игру от первого лица. В абстракте отдельно отмечено, что итоговая версия содержала не только код: в ней были связный сюжет, основные игровые правила, пригодный для человека игровой процесс, улучшенная графика и встроенный звук. Это показывает не просто способность исправлять отдельные функции, а попытку поддерживать целостность большого проекта на протяжении долгой серии изменений.

Ключевые цифры

3 связки инструментов и моделейПодход проверили не на одной конкретной системе: в эксперименте участвовали три разных сочетания программного инструмента и ИИ-модели.
более 70 итерацийВ длительном запуске агент возвращался к проекту десятки раз, последовательно развивая его, а не ограничился одной генерацией кода.
52,25%В среднем надстройка заметно опережала те же инструменты без управляющего слоя на использованных тестах.
82,86%В лучшем сравнении разрыв с исходным инструментом оказался почти в полтора раза больше его результата.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не прошла обычная журнальная проверка другими учёными. Результаты выглядят содержательно, но их проверили на трёх тестах и трёх связках инструментов с моделями, а длительная демонстрация игры — это один отдельный запуск; по абстракту нельзя понять, насколько стабильно такой процесс повторится на других проектах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас2 сентября 2026 г.
Дата источника31 августа 2026 г.
ОригиналОткрыть
АвторыHaoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu