Препринт — материал ещё не прошёл рецензирование
TreeSeeker показывает лучший результат на бенчмарках глубокого поиска
Кратко
TreeSeeker — это схема поиска с ветвлением и возвратом, которая работает на этапе вывода и помогает агенту выбирать между развитием удачной ветки, исследованием альтернатив и отсечением тупиков. В экспериментах на XBench-DeepSearch, BrowseComp и BrowseComp-ZH она показала лучшие результаты, чем сильные open-source базовые модели.
Зачем это знать
Работа намекает, что более явный контроль над тем, когда искать дальше, а когда возвращаться назад, может помочь в многошаговом поиске и синтезе фактов. Но это пока только препринт и бенчмарк-эксперименты, поэтому выводы не стоит переносить на реальные сценарии без дополнительных проверок.
Разбор
Авторы сделали не просто ещё один поиск по интернету, а встроили в работу агента понятный механизм выбора хода. Идея такая: когда у сложного вопроса есть несколько правдоподобных направлений, система не должна упрямо идти по первой удачной тропинке. Вместо этого она может продолжать сильную ветку, попробовать другую или вернуться назад и отрезать тупик. Именно так и устроен TreeSeeker — как поиск по дереву, где каждая ветка хранит отдельную попытку разобраться в подзадаче.
Чтобы это работало не наугад, в каждом раунде система смотрит на все текущие подзадачи и оценивает их по трём вещам: насколько ветка выглядит полезной, насколько в ней много неопределённости и насколько велик риск зайти в тупик. На основе этого она решает, что выгоднее прямо сейчас: развивать уже перспективный путь, исследовать менее понятный вариант или отказаться от неудачной линии и вернуться к более ранней развилке. То есть ключ здесь не в «поиске вообще», а в управлении поиском в процессе рассуждения.
Ещё одна важная часть — память о попытках. TreeMem сохраняет к веткам не только найденные факты, но и сигналы о конфликте, прогрессе, неясности и сбое. Это нужно, чтобы прошлые ошибки и удачи реально влияли на следующие шаги, а не терялись по дороге. В экспериментах на трёх бенчмарках такой подход стабильно обошёл сильные open-source базовые модели, так что авторы показывают: иногда выигрывает не та система, которая «думает глубже» сама по себе, а та, которая лучше умеет вовремя остановиться, свернуть и попробовать другой путь.
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли независимые рецензенты. Авторы тестировали систему только на бенчмарках, а не в живом продукте, поэтому её поведение в реальном поиске может быть менее стабильным. При этом сравнение шло с сильными open-source базовыми моделями, так что результат выглядит содержательно, но пока его стоит считать предварительным.
Пересказано ИИ по научной статье. Как это устроено