Препринт — материал ещё не прошёл рецензирование
Автономный режим выполнял больше работы, чем поиск
Кратко
В анализе сравнили близкие по смыслу запросы в двух продуктах Perplexity: Search и Computer. На данных одной компании автономный Computer выполнял заметно больше работы за сессию, а также был связан с более быстрым завершением задач и меньшей неудовлетворённостью.
Зачем это знать
Это показывает, как автономные ИИ-агенты могут менять саму организацию работы: не только отвечать, но и выполнять шаги задачи. Но вывод основан на препринте и наблюдательных данных, поэтому его стоит считать предварительным, а не готовой рекомендацией для практики.
Разбор
Авторы не просто сравнили два продукта «в лоб», а постарались поймать один и тот же тип задачи в двух режимах работы. Для этого они брали почти одинаковые первые запросы от одного и того же пользователя в Search и в Computer и сопоставляли их как пары. Смысл был в том, чтобы убрать главный перекос: люди сами выбирают, что отправить в один режим и что — в другой, а значит, без такого сравнения легко спутать особенности задачи с особенностями продукта.
Дальше они смотрели, что происходит уже в самой сессии. Для Computer измеряли, сколько времени система реально работала между ходами пользователя, сколько раз она обращалась к внешним инструментам и как часто потом возникало недовольство ответом. Для Search брали обычный сценарий поиска. Получилось, что автономный режим не просто «отвечал», а сам разбивал задачу на части и выполнял их, поэтому после него у пользователей чаще оставались вопросы уровня проверки и расширения результата, а не базового поиска.
Ещё один важный результат — время до завершения задачи. На сопоставленных задачах Computer доводил работу до конца намного быстрее, а оценка времени и затрат на такие задачи падала очень заметно. Параллельно авторы увидели, что пользователи с Computer брались за более сложные и более «составные» запросы — такие, где в одном обращении сразу несколько зависимых шагов. То есть автономность меняла не только скорость, но и сам масштаб того, что люди готовы поручить системе.
Это исследование важно ещё и потому, что раньше сравнивать такие режимы было трудно: в реальной жизни люди не задают один и тот же вопрос в двух интерфейсах буквально под копирку. Здесь как раз и используют похожие запросы одного пользователя как естественный эксперимент, чтобы приблизиться к честному сравнению. Но это всё ещё наблюдательные данные из одного продукта, а не лабораторный тест с полным контролем над условиями.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не проверяли рецензенты. Плюс сравнение основано на данных одной компании и на наблюдении за поведением пользователей, а не на полном лабораторном эксперименте. Зато выборка большая и сравнение близких запросов одного и того же пользователя делает выводы заметно сильнее, чем обычное сравнение «средней температуры по больнице».
Пересказано ИИ по научной статье. Как это устроено