Препринт — материал ещё не прошёл рецензирование
Новая схема помогает языковым моделям решать более трудный код
0
Кратко
DecompRL — это метод обучения с подкреплением, который учит языковую модель разбирать задачу на маленькие части, писать их отдельно и потом собирать обратно. В тестах на двух наборах задач по программированию он дал лучшие результаты для моделей Qwen 2.5 7B и Code World Model 32B и снизил расход GPU-токенов примерно в 50 раз.
Зачем это знать
Это может пригодиться разработчикам ИИ-систем, которым важно решать сложные задачи без резкого роста вычислительных затрат. Проверяли на конкретных наборах задач по программированию, так что до более широких выводов ещё далеко.
Пересказано ИИ по научной статье. Как это устроено
Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас3 июля 2026 г.
Дата источника2 июля 2026 г.
ОригиналОткрыть
АвторыJuliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve