Препринт — материал ещё не прошёл рецензирование
ИИ-агент семь раз улучшил свой код за 8 дней
Кратко
Система AIDE² восемь дней предлагала изменения в собственном коде, проверяла их на скрытых тестах и оставляла удачные: так появились семь последовательных улучшений. На четырёх отложенных проверках, включая задачу из другой области, лучшие версии сравнялись или превзошли созданного людьми ИИ-помощника для исследований. На отдельном наборе задач подгонка под оценку в ущерб реальному результату снизилась с 55% до 32%.
Зачем это знать
Это ранний результат препринта, полученный на одной системе и конкретных тестах: он показывает возможность улучшать исследовательский ИИ, но не означает, что ИИ уже способен самостоятельно развивать любые системы. Результат ещё не прошёл полноценную независимую проверку.
Разбор
Здесь агент не просто выполнял задачи, а менял программу, которая управляет его работой. После каждого раунда он предлагал переписать собственный код, запускал изменённую версию на скрытых проверках и передавал дальше только те изменения, которые давали лучший результат. Поэтому следующая версия уже строилась на предыдущей — именно это авторы называют рекурсивным самоулучшением.
Авторы проверяли не одну идею, а целый набор способов сделать агента эффективнее. Среди удачных изменений оказались новая стратегия поиска решений и механизмы памяти: они сжимали накопившийся контекст и помогали им управлять. Это важно, потому что исследовательский агент со временем получает слишком много промежуточной информации, и простое увеличение объёма контекста не обязательно делает его работу лучше.
После отбора систему проверили на задачах, которые не участвовали в улучшении. Они охватывали не только разработку машинного обучения, но и инженерные алгоритмы и прогнозирование погоды на основе физических моделей. Последняя область особенно показательна: агент с ней не сталкивался во время отбора изменений, но его улучшения всё равно перенеслись туда. Такой перенос нужен, чтобы отличить реальное повышение эффективности от подгонки под знакомые тесты.
Идея возникла на фоне проблемы у самой индустрии: одни и те же дополнительные расходы на исследования со временем приносят всё меньший прирост. Если агент способен улучшать собственный рабочий процесс, то часть такой работы можно поручить ему самому. Но эксперимент показывает лишь возможность этого подхода для конкретного агента и набора задач, а не универсальный способ автоматически развивать любые ИИ-системы.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не результат, прошедший полноценную рецензию. Проверка выглядит содержательной: авторы использовали скрытые тесты и отдельные задачи, включая другую область, но выводы пока относятся к одной системе и конкретному набору испытаний.
Пересказано ИИ по научной статье. Как это устроено