dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Набор данных учит модели собирать репозитории целиком

0

Кратко

Авторы представили DeNovoSWE — набор из 4 818 примеров, где нужно создать целый репозиторий по документации. На этом preprint'е fine-tuning модели Qwen3-30B-A3B заметно поднял результат на бенчмарке BeyondSWE-Doc2Repo с 5.8% до 47.2%.

Зачем это знать

Это показывает, что для длинных задач в программировании можно собирать обучающие данные не только для локальных правок, но и для создания проекта целиком. Но вывод пока предварительный: это arXiv-preprint, а заметный рост показан на одном бенчмарке и для одной конкретной модели.

Разбор

Авторы взялись за задачу, которую обычно обходили стороной: не чинить кусочек кода, а собирать проект целиком по документации. Для этого они сделали DeNovoSWE — набор примеров, где у модели есть только описание, а на выходе должен получиться готовый репозиторий. Такой формат важен, потому что для длинных задач в разработке данных обычно не хватает: проверяемых примеров целого проекта куда меньше, чем задач на локальную правку.

Сам набор собрали не вручную, а через специально устроенный автоматический процесс в изолированной среде. Если по-простому, модель сама проходила путь создания проекта, а система следила за качеством и отбрасывала слабые попытки. Авторы опирались на логику «разделяй и властвуй» — разбивать большую задачу на части — и на схему «критик-ремонт», то есть сначала находить ошибки, а потом исправлять их. Чтобы в данных не было однообразия и при этом не потерялось качество, они ещё добавили фильтр, который учитывает сложность получившихся траекторий.

Главный практический результат такой: после дообучения на DeNovoSWE модель Qwen3-30B-A3B намного лучше справлялась с длинными задачами по разработке. Это не просто косметический сдвиг, а резкий рост на сложном тесте BeyondSWE-Doc2Repo. При этом авторы явно показывают, что речь идёт именно о первом шаге к обучению на задачах уровня целого репозитория, а не о готовом универсальном решении.

Ключевые цифры

4 818 примеровЭто уже не маленькая подборка, а достаточно большой корпус задач, на котором можно учить модель не случайным удачам, а устойчивому навыку.
5.8%До обучения на новом наборе модель почти не справлялась с задачей целиком — успех был скорее редким исключением.
47.2%После дообучения модель стала заметно чаще решать длинную задачу правильно, хотя до идеала ей всё ещё далеко.

Можно ли доверять

Это preprint на arXiv, то есть работу ещё не прошли через обычную независимую рецензию. Результат показали на одном бенчмарке и на одной модели, так что общий вывод выглядит многообещающе, но его ещё нужно проверять на других системах и задачах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас11 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыJiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia