Препринт — материал ещё не прошёл рецензирование
Набор данных учит модели собирать репозитории целиком
Кратко
Авторы представили DeNovoSWE — набор из 4 818 примеров, где нужно создать целый репозиторий по документации. На этом preprint'е fine-tuning модели Qwen3-30B-A3B заметно поднял результат на бенчмарке BeyondSWE-Doc2Repo с 5.8% до 47.2%.
Зачем это знать
Это показывает, что для длинных задач в программировании можно собирать обучающие данные не только для локальных правок, но и для создания проекта целиком. Но вывод пока предварительный: это arXiv-preprint, а заметный рост показан на одном бенчмарке и для одной конкретной модели.
Разбор
Авторы взялись за задачу, которую обычно обходили стороной: не чинить кусочек кода, а собирать проект целиком по документации. Для этого они сделали DeNovoSWE — набор примеров, где у модели есть только описание, а на выходе должен получиться готовый репозиторий. Такой формат важен, потому что для длинных задач в разработке данных обычно не хватает: проверяемых примеров целого проекта куда меньше, чем задач на локальную правку.
Сам набор собрали не вручную, а через специально устроенный автоматический процесс в изолированной среде. Если по-простому, модель сама проходила путь создания проекта, а система следила за качеством и отбрасывала слабые попытки. Авторы опирались на логику «разделяй и властвуй» — разбивать большую задачу на части — и на схему «критик-ремонт», то есть сначала находить ошибки, а потом исправлять их. Чтобы в данных не было однообразия и при этом не потерялось качество, они ещё добавили фильтр, который учитывает сложность получившихся траекторий.
Главный практический результат такой: после дообучения на DeNovoSWE модель Qwen3-30B-A3B намного лучше справлялась с длинными задачами по разработке. Это не просто косметический сдвиг, а резкий рост на сложном тесте BeyondSWE-Doc2Repo. При этом авторы явно показывают, что речь идёт именно о первом шаге к обучению на задачах уровня целого репозитория, а не о готовом универсальном решении.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, то есть работу ещё не прошли через обычную независимую рецензию. Результат показали на одном бенчмарке и на одной модели, так что общий вывод выглядит многообещающе, но его ещё нужно проверять на других системах и задачах.
Пересказано ИИ по научной статье. Как это устроено