dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

ИИ заметно теряют в качестве, когда сами выбирают метод исследования

0

Кратко

В тесте на 60 исследовательских задачах из 11 научных областей сравнили 18 вариантов систем ИИ. Средний результат упал с 50,91 до 26,62 балла, когда системы должны были сами выбрать способ работы, а не следовать подробным указаниям.

Зачем это знать

Результат указывает, что самостоятельный выбор метода остаётся слабым местом современных ИИ. Но бенчмарк проверял специально разработанные задачи и не показывает напрямую, как системы справятся со всеми видами реальной научной работы.

Разбор

Авторы собрали не отдельные вопросы, а 60 небольших научных проектов: в каждом нужно пройти несколько шагов — выбрать подход, провести работу и получить результат, который можно проверить. Главная идея теста — постепенно убирать помощь человека. Сначала системе дают подробные инструкции, затем сообщают только, каким должен быть метод, а в самом сложном режиме просят её выбрать этот метод самостоятельно. Так проверяют не только умение отвечать, но и способность организовать исследование целиком.

Бенчмарк создавали более 40 экспертов, потративших свыше 31 тысячи человеко-часов. Чтобы задания не сводились к субъективной оценке, их проверяли специалисты, дополнительно анализировали с помощью ИИ, запускали в изолированной среде и отдельно проверяли систему подсчёта баллов. В промежуточном режиме, когда метод уже задан, средний результат составил 29,10 балла — заметно ниже результата при подробных подсказках, но выше, чем при полностью самостоятельном выборе. Это показывает: трудность возникает не только в выполнении действий, но и в решении, какие действия вообще нужны.

Ключевые цифры

31 000+ человеко-часовСтолько времени эксперты потратили на создание и проверку набора — это не быстрый тест из нескольких случайных вопросов.
29,10 баллаТаков средний результат, когда системе уже называют метод, но не расписывают все шаги; одной подсказки о подходе ей часто недостаточно.
18 конфигурацийСравнили 18 сочетаний моделей и исследовательских агентов, поэтому вывод относится не к одной конкретной системе.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая рецензирование журнала. Задания прошли экспертную проверку и несколько этапов аудита, но тест остаётся специально созданным бенчмарком: он показывает поведение систем в его условиях, а не гарантирует такой же результат в реальных научных проектах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас19 августа 2026 г.
Дата источника17 августа 2026 г.
ОригиналОткрыть
АвторыJunwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao