Препринт — материал ещё не прошёл рецензирование
Новый бенчмарк сравнивает кодирующих агентов на равных условиях
Кратко
Claw-SWE-Bench — это мультиязычный набор задач и протокол адаптеров для сравнения разных оболочек кодирующих агентов на одинаковых условиях. Авторы проверили его на задачах по исправлению кода на 8 языках и показали, что результат сильно зависит и от модели, и от выбранной оболочки.
Зачем это знать
Работа важна как способ более честно измерять, насколько хорошо разные агентные системы справляются с задачами программирования. Но это пока предрелизный результат на arXiv, поэтому его стоит рассматривать как основу для сравнения, а не как готовую практическую рекомендацию.
Разбор
Авторы не просто взяли одну модель и прогнали её по привычному набору задач. Они построили отдельный слой — «оболочку» для кодирующего агента, чтобы разные системы можно было сравнивать в одинаковых условиях: с одним и тем же запросом, лимитом времени, правилами для рабочей папки и одинаковым способом достать патч с исправлением. Это важно, потому что без такого слоя один агент может выглядеть лучше не из-за ума, а из-за более удобной обвязки.
Проверка шла на задачах по исправлению кода на восьми языках и в 43 репозиториях. Для этого авторы собрали полный набор из 350 примеров и отдельно сделали облегчённую версию для быстрой проверки. Интересный момент в том, что они не просто искали «самый дешёвый» набор: они отбирали примеры так, чтобы маленькая версия сохраняла поведение полной, то есть давала похожую картину по результатам.
Самый сильный вывод здесь даже не про конкретную модель, а про зависимость от всей системы целиком. На одном и том же «движке» OpenClaw с разной оболочкой результат менялся очень сильно: от 19.1% до 73.4% успеха на первой попытке. А если смотреть шире, то выбор модели и выбор оболочки влияли на качество почти одинаково сильно. Это хороший сигнал, что в таких бенчмарках нельзя оценивать только саму языковую модель — способ её запуска меняет итог не меньше.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, то есть работу ещё не прошли внешнее рецензирование. При этом авторы проверили подход не на игрушечных примерах, а на 350 задачах в нескольких языках и на разных оболочках, так что база у результата серьёзная. Но поскольку это новый бенчмарк и новый протокол, лучше воспринимать его как сильный инструмент для сравнения, а не как окончательный стандарт на все случаи.
Пересказано ИИ по научной статье. Как это устроено