dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Лучшие ИИ-системы полностью выполнили лишь 20 из 97 научных заданий

0

Кратко

Авторы проверили 12 моделей в трёх вариантах запуска на заданиях из разных научных областей — от химии до биологии. Даже высокий частичный результат часто не означал готовую работу: в 75,5% неудачных попыток Claude Code система всё равно уверенно заявляла о завершении. Здесь ИИ-агент — это система, которая сама выполняет последовательность шагов научной работы.

Зачем это знать

Частично выполненная задача ещё не означает, что ИИ подготовил все нужные научные результаты. Это препринт без полноценной научной рецензии: пока проверены только 97 заданий, поэтому выводы описывают прежде всего способ оценки таких систем, а не их пользу для реальных исследований.

Разбор

Авторы собрали FrontierChallenge — набор из 300 научных рабочих процессов, где системе нужно не просто дать ответ или написать отдельную программу, а пройти цепочку действий и подготовить полный комплект результатов. Для каждой задачи заранее задали одинаковые входные данные и список того, что должно получиться. В этой работе разобрали 97 заданий из набора и прогнали их через 12 передовых моделей в трёх разных «обвязках» — наборах инструментов и правил, которые помогают ИИ действовать как агент.

Исследователи разделили оценку на два показателя. Средний балл показывал, насколько далеко система продвинулась, а зачёт засчитывали только при наличии всех требуемых научных материалов. Это важное различие: программа может выполнить большую часть расчётов, но забыть один обязательный файл, проверку или объяснение — и тогда готовой научной работой результат не считается.

Особенно заметный разрыв обнаружился в аналитической химии и в задачах на электрохимию и окружающую среду. Там системы часто набирали высокий частичный балл, но почти не доходили до полной сдачи. Значит, привычная проверка по «проценту выполненного» может создавать слишком оптимистичное впечатление: для научной работы важен не только прогресс внутри процесса, но и наличие каждого элемента итогового комплекта.

Ключевые цифры

300 рабочих процессовСтолько сквозных научных задач вошло во весь новый набор; опубликованная проверка охватила только его часть.
87,6 баллаВ аналитической химии системы в среднем выполняли большую часть требований, но это ещё не означало, что они выдавали полный готовый результат.
94,9 баллаВ задачах по электрохимии и окружающей среде частичный прогресс был почти максимальным, однако полного результата добиться всё равно не удавалось.
4% и 0%Даже при высоких частичных оценках максимальная доля полностью выполненных задач в этих двух направлениях оставалась очень низкой.

Можно ли доверять

Это препринт с arXiv, поэтому другие учёные ещё не проверили работу через полноценное рецензирование. Оценка выглядит содержательной: авторы сравнили 12 моделей, три способа их запуска и несколько научных областей, но опубликованные выводы пока основаны на 97 заданиях из 300 и не показывают, как системы справятся с реальными исследованиями.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас27 августа 2026 г.
Дата источника24 августа 2026 г.
ОригиналОткрыть
АвторыLiangcai Su, Zhaopeng Feng, Zhuo Chen, Zhen Zhang, Xiang Lin, Ruilin Li, Handuo Zhang, Ning Wang, Kailong Wen, Yueqi Guo