Препринт — материал ещё не прошёл рецензирование
13 ИИ-агентов вместе улучшили результат в одной задаче
Кратко
Авторы создали систему, где каждый шаг нескольких ИИ-агентов сохраняется в общей проверяемой истории: другие могут увидеть, на чём он основан, и повторить его. За почти 12 дней 13 агентов оставили 1703 вклада, а показатель качества в специальной задаче снизился с 3,39 до 1,899; один из лучших результатов независимо повторили 165 раз.
Зачем это знать
Это показывает, как несколько ИИ-агентов могут не начинать поиск заново, а продолжать работу друг друга. Один запуск на специальной задаче ещё не доказывает, что такая организация лучше независимой работы при том же объёме вычислений — для этого нужно прямое сравнение.
Разбор
Проблема была в том, что отдельные ИИ-агенты обычно начинают поиск с нуля: даже если один нашёл полезную идею, следующий запуск не знает о ней и может повторить тот же путь. Авторы предложили общую память под названием Agora. Каждый результат, догадка или проверка записывается в Git как неизменяемая запись, а связи между записями показывают, какую идею развивает следующий шаг. Поэтому любой участник может открыть цепочку рассуждений, воспроизвести эксперимент и продолжить работу с нужного места.
Систему проверили на необычной задаче переноса знаний между моделями. У исследователей были готовые модели-«доноры» и новая модель другой формы, которую нельзя было просто дообучить: не разрешались ни обучающие данные, ни обновление параметров градиентом. Агентам пришлось переносить полезную информацию через настройки целевой модели. Лучший подход использовал статистику предсказаний следующих слов из моделей-доноров, сжимал её в начальный слой и выходной слой новой модели, а затем добавлял сигнал о ближайшем контексте небольшими изменениями внутри нескольких типов блоков.
Важно и то, как шёл поиск. У агентов не было заранее разданных ролей и центрального руководителя; система сама показывала незакрытые направления и следила, чтобы все не скопировались на одну и ту же идею. Авторы всё же один раз вмешались по ходу работы, когда участники начали сходиться к слишком узкому набору решений. Это показывает не только успех метода, но и его границу: один длительный запуск демонстрирует, что совместная история может поддерживать воспроизводимый поиск, однако ещё не доказывает преимущество над независимыми агентами при одинаковом количестве вычислений.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не результат, прошедший независимую рецензию. Проверка была одной длительной демонстрацией на специальной задаче; авторы сами отмечают, что нужен контролируемый эксперимент, чтобы сравнить общую память с независимой работой при одинаковых вычислительных затратах.
Пересказано ИИ по научной статье. Как это устроено