dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Новый бенчмарк сравнивает кодирующих агентов на равных условиях

0

Кратко

Claw-SWE-Bench — это мультиязычный набор задач и протокол адаптеров для сравнения разных оболочек кодирующих агентов на одинаковых условиях. Авторы проверили его на задачах по исправлению кода на 8 языках и показали, что результат сильно зависит и от модели, и от выбранной оболочки.

Зачем это знать

Работа важна как способ более честно измерять, насколько хорошо разные агентные системы справляются с задачами программирования. Но это пока предрелизный результат на arXiv, поэтому его стоит рассматривать как основу для сравнения, а не как готовую практическую рекомендацию.

Разбор

Авторы не просто взяли одну модель и прогнали её по привычному набору задач. Они построили отдельный слой — «оболочку» для кодирующего агента, чтобы разные системы можно было сравнивать в одинаковых условиях: с одним и тем же запросом, лимитом времени, правилами для рабочей папки и одинаковым способом достать патч с исправлением. Это важно, потому что без такого слоя один агент может выглядеть лучше не из-за ума, а из-за более удобной обвязки.

Проверка шла на задачах по исправлению кода на восьми языках и в 43 репозиториях. Для этого авторы собрали полный набор из 350 примеров и отдельно сделали облегчённую версию для быстрой проверки. Интересный момент в том, что они не просто искали «самый дешёвый» набор: они отбирали примеры так, чтобы маленькая версия сохраняла поведение полной, то есть давала похожую картину по результатам.

Самый сильный вывод здесь даже не про конкретную модель, а про зависимость от всей системы целиком. На одном и том же «движке» OpenClaw с разной оболочкой результат менялся очень сильно: от 19.1% до 73.4% успеха на первой попытке. А если смотреть шире, то выбор модели и выбор оболочки влияли на качество почти одинаково сильно. Это хороший сигнал, что в таких бенчмарках нельзя оценивать только саму языковую модель — способ её запуска меняет итог не меньше.

Ключевые цифры

350Полный бенчмарк охватывает 350 реальных задач по исправлению кода, так что это не проверка на горстке примеров.
8 языковСравнение не застряло на одном языке программирования — проверили, насколько подход работает в разных экосистемах.
43 репозиторияЗадачи взяли из десятков разных проектов, поэтому результат меньше зависит от особенностей одного кода.
19.1% и 73.4%Один и тот же базовый агент с разной оболочкой может выглядеть либо слабым, либо очень сильным — разница огромная.

Можно ли доверять

Это preprint на arXiv, то есть работу ещё не прошли внешнее рецензирование. При этом авторы проверили подход не на игрушечных примерах, а на 350 задачах в нескольких языках и на разных оболочках, так что база у результата серьёзная. Но поскольку это новый бенчмарк и новый протокол, лучше воспринимать его как сильный инструмент для сравнения, а не как окончательный стандарт на все случаи.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыMengyu Zheng, Kai Han, Boxun Li, Haiyang Xu, Yuchuan Tian, Wei He, Hang Zhou, Jianyuan Guo, Hailin Hu, Lin Ma