dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

ИИ-агенты справились с инженерной частью, но не с самой исследовательской задачей

0

Кратко

Авторы проверили два фронтирных ИИ-агента на двух непубликованных работах по ИИ и дали им по шесть дней и много вычислений. В обоих случаях агенты сделали всю инженерную работу без человека, но не смогли существенно продвинуться в ответе на главный исследовательский вопрос.

Зачем это знать

Это ранний сигнал, что такие системы уже могут брать на себя часть исследовательской рутины, но пока не заменяют то, что делает работу научной. За их развитием стоит следить именно как за инструментом для отдельных этапов исследований, а не как за готовой заменой исследователя.

Разбор

Авторы придумали любопытный тест на «умение заниматься наукой», а не просто выполнять узкие задачи. Они взяли два свежих, но ещё не опубликованных исследования по ИИ, где был важен открытый исследовательский вопрос, и отдали их фронтирным ИИ-агентам — то есть системам, которые умеют сами планировать шаги, писать код и запускать эксперименты. Дальше агенты работали почти как автономные стажёры: шесть дней подряд и с большим бюджетом на вычисления.

Смысл такой проверки в том, что обычные бенчмарки часто слишком «игрушечные»: там есть чёткий правильный ответ, и система либо попала в него, либо нет. А настоящая исследовательская работа устроена иначе — там нужно выбрать, что вообще считать хорошим направлением, заметить слабое место в дизайне эксперимента, отступить, если тупик, и не сбиться с цели. Авторы хотели увидеть, умеют ли агенты именно в этот более грязный и живой процесс.

Результат получился смешанный. Агенты сами закрыли всю инженерную часть — то есть всё, что связано с кодом, экспериментами и технической реализацией, без помощи человека. Но там, где нужно было реально приблизиться к ответу на главный вопрос работы, они почти не продвинулись. Более того, оригинальные авторы двух статей после проверки таких попыток однозначно отклонили результаты: полезного научного вклада оказалось недостаточно.

Ещё важная деталь: исследователи не остановились на одном прогоне. Они проверили устойчивость вывода с другой моделью и другим «каркасом» управления агентом, и те же проблемы повторились. В итоге картина выглядит так: сегодняшние ИИ уже неплохо берут на себя рутину в исследованиях, но пока не тянут те части, где нужна научная интуиция, выбор стратегии и умение не застревать в тупиках.

Ключевые цифры

2 unpublished NeurIPS 2026 submissionsВывод сделали не на одной удачной задаче, а на двух реальных исследовательских проектах, что делает тест более содержательным.
6 daysАгентам дали не минутный прогон, а почти рабочую неделю на попытку решить исследовательскую задачу.
thousands of dollars of computeНа эксперименты не жалели ресурсов, так что провал нельзя списать на слишком маленький бюджет.

Можно ли доверять

Это preprint на arXiv, то есть работу ещё не проверяли независимые рецензенты. При этом проверка не игрушечная: авторы тестировали агентов на реальных, пусть и ещё не опубликованных, исследованиях, а не на синтетических задачках. Но выборка очень маленькая — всего две работы — поэтому это хороший ранний сигнал, а не окончательный приговор для всех ИИ-агентов.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас30 июля 2026 г.
Дата источника28 июля 2026 г.
ОригиналОткрыть
АвторыPeter Kirgis, Sayash Kapoor, Andrew Schwartz, Stephan Rabanser, David Africa, Konstantinos Voudouris, Viet Nguyen, Toby Pilditch, Magda Dubois, Harry Coppock