Препринт — материал ещё не прошёл рецензирование
ИИ превзошёл лучший человеческий результат на олимпиаде по программированию
Кратко
Специализированная система набрала 535,4 из 600 баллов на задачах международной олимпиады по программированию — против 498,27 балла у человека с лучшим результатом при тех же ограничениях. Её обучали на 22 000 задач, а затем она многократно создавала решения, проверяла их и исправляла ошибки.
Зачем это знать
Авторы называют это первым таким результатом, но вывод пока основан на препринте и ещё не прошёл независимую проверку. Кроме того, он относится к специально настроенной системе и соревнованиям, а не доказывает, что ИИ лучше людей в обычной разработке программ или общем рассуждении.
Разбор
Авторы собрали не просто большую языковую модель, а целую систему под формат олимпиады. Сначала они отобрали 22 000 задач, добавили примеры рассуждений, затем дообучили модели на правильных решениях и отдельно использовали обучение с подкреплением — подход, при котором система получает сигнал за успешный результат и постепенно меняет стратегию.
Главное отличие — механизм GenCorrect. Во время самого решения система не останавливается на первом варианте: она создаёт несколько разных решений, проверяет их на тестах, находит ошибки и дорабатывает наиболее перспективные. Такой подход заметно изменил результат Nano-CC: после основного обучения её показатель вырос со 130 до 291 балла, а с дополнительной проверкой и исправлением — до 468. Более крупная Ultra-CC без этого этапа набрала 502 балла.
Авторы сначала проверили модели на IOI 2025, а затем заранее оценили специально настроенную версию на следующем наборе задач — IOI 2026. Для этой проверки системе оставили те же ограничения по времени, доступу к интернету и числу отправок решений, что и людям. Это важно: результат получен не только за счёт возможности бесконечно запускать программу или искать подсказки в сети, а в условиях самого соревнования.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая независимую рецензию. Результат проверили на задачах олимпиады и в условиях соревнования, но абстракт описывает одну специализированную систему, поэтому пока нельзя считать вывод универсальным для других задач или обычной разработки.
Пересказано ИИ по научной статье. Как это устроено