dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Автономный режим выполнял больше работы, чем поиск

0

Кратко

В анализе сравнили близкие по смыслу запросы в двух продуктах Perplexity: Search и Computer. На данных одной компании автономный Computer выполнял заметно больше работы за сессию, а также был связан с более быстрым завершением задач и меньшей неудовлетворённостью.

Зачем это знать

Это показывает, как автономные ИИ-агенты могут менять саму организацию работы: не только отвечать, но и выполнять шаги задачи. Но вывод основан на препринте и наблюдательных данных, поэтому его стоит считать предварительным, а не готовой рекомендацией для практики.

Разбор

Авторы не просто сравнили два продукта «в лоб», а постарались поймать один и тот же тип задачи в двух режимах работы. Для этого они брали почти одинаковые первые запросы от одного и того же пользователя в Search и в Computer и сопоставляли их как пары. Смысл был в том, чтобы убрать главный перекос: люди сами выбирают, что отправить в один режим и что — в другой, а значит, без такого сравнения легко спутать особенности задачи с особенностями продукта.

Дальше они смотрели, что происходит уже в самой сессии. Для Computer измеряли, сколько времени система реально работала между ходами пользователя, сколько раз она обращалась к внешним инструментам и как часто потом возникало недовольство ответом. Для Search брали обычный сценарий поиска. Получилось, что автономный режим не просто «отвечал», а сам разбивал задачу на части и выполнял их, поэтому после него у пользователей чаще оставались вопросы уровня проверки и расширения результата, а не базового поиска.

Ещё один важный результат — время до завершения задачи. На сопоставленных задачах Computer доводил работу до конца намного быстрее, а оценка времени и затрат на такие задачи падала очень заметно. Параллельно авторы увидели, что пользователи с Computer брались за более сложные и более «составные» запросы — такие, где в одном обращении сразу несколько зависимых шагов. То есть автономность меняла не только скорость, но и сам масштаб того, что люди готовы поручить системе.

Это исследование важно ещё и потому, что раньше сравнивать такие режимы было трудно: в реальной жизни люди не задают один и тот же вопрос в двух интерфейсах буквально под копирку. Здесь как раз и используют похожие запросы одного пользователя как естественный эксперимент, чтобы приблизиться к честному сравнению. Но это всё ещё наблюдательные данные из одного продукта, а не лабораторный тест с полным контролем над условиями.

Ключевые цифры

26 минутСтолько автономной работы в среднем выполнял Computer за одну сессию — не просто отвечал, а сам делал шаги задачи.
33 секундыСтолько в среднем занимал Search за сессию на сопоставимых запросах — разница показывает, насколько дольше работает автономный режим.
55%На Computer пользователи заметно реже выражали неудовлетворённость ответом, то есть результат чаще попадал в ожидания.
87% и 94%По оценке авторов, автономный режим сильно снижал время и стоимость выполнения задач по сравнению с человеком, который использует только Search.

Можно ли доверять

Это препринт на arXiv, его ещё не проверяли рецензенты. Плюс сравнение основано на данных одной компании и на наблюдении за поведением пользователей, а не на полном лабораторном эксперименте. Зато выборка большая и сравнение близких запросов одного и того же пользователя делает выводы заметно сильнее, чем обычное сравнение «средней температуры по больнице».

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас8 июня 2026 г.
Дата источника5 июня 2026 г.
ОригиналОткрыть
АвторыJeremy Yang, Kate Zyskowski, Noah Yonack, Jerry Ma