dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

ИИ превзошёл лучший человеческий результат на олимпиаде по программированию

0

Кратко

Специализированная система набрала 535,4 из 600 баллов на задачах международной олимпиады по программированию — против 498,27 балла у человека с лучшим результатом при тех же ограничениях. Её обучали на 22 000 задач, а затем она многократно создавала решения, проверяла их и исправляла ошибки.

Зачем это знать

Авторы называют это первым таким результатом, но вывод пока основан на препринте и ещё не прошёл независимую проверку. Кроме того, он относится к специально настроенной системе и соревнованиям, а не доказывает, что ИИ лучше людей в обычной разработке программ или общем рассуждении.

Разбор

Авторы собрали не просто большую языковую модель, а целую систему под формат олимпиады. Сначала они отобрали 22 000 задач, добавили примеры рассуждений, затем дообучили модели на правильных решениях и отдельно использовали обучение с подкреплением — подход, при котором система получает сигнал за успешный результат и постепенно меняет стратегию.

Главное отличие — механизм GenCorrect. Во время самого решения система не останавливается на первом варианте: она создаёт несколько разных решений, проверяет их на тестах, находит ошибки и дорабатывает наиболее перспективные. Такой подход заметно изменил результат Nano-CC: после основного обучения её показатель вырос со 130 до 291 балла, а с дополнительной проверкой и исправлением — до 468. Более крупная Ultra-CC без этого этапа набрала 502 балла.

Авторы сначала проверили модели на IOI 2025, а затем заранее оценили специально настроенную версию на следующем наборе задач — IOI 2026. Для этой проверки системе оставили те же ограничения по времени, доступу к интернету и числу отправок решений, что и людям. Это важно: результат получен не только за счёт возможности бесконечно запускать программу или искать подсказки в сети, а в условиях самого соревнования.

Ключевые цифры

130 → 291 → 468 балловУ небольшой модели основное обучение больше чем утроило результат, а многократная проверка и исправление решений добавили ещё заметный прирост.
438,3 баллаЭто был порог, который требовался для получения золотой медали на IOI 2025; после применения GenCorrect модель оказалась выше него.
502 баллаТакой результат показала более крупная модель Ultra-CC на задачах IOI 2025 даже без отдельного механизма многократного исправления.
361,12 баллаТаков золотой порог на использованном авторами наборе IOI 2026 — он показывает, насколько высокий уровень требовался для сравнения.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая независимую рецензию. Результат проверили на задачах олимпиады и в условиях соревнования, но абстракт описывает одну специализированную систему, поэтому пока нельзя считать вывод универсальным для других задач или обычной разработки.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас3 сентября 2026 г.
Дата источника1 сентября 2026 г.
ОригиналОткрыть
АвторыAleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg