Препринт — материал ещё не прошёл рецензирование
Закрытая спектральная схема для объединения моделей оказалась быстрее и не хуже итеративных методов
Кратко
Авторы предложили закрытую спектральную фильтрацию для объединения нескольких дообученных моделей в одну. На бенчмарках SWUDI и SWUDI-A работали на уровне лучших итеративных методов или лучше, при этом обходились без данных для обучения и состояния оптимизатора.
Зачем это знать
Это указывает, что в таких задачах дорогой итеративный цикл можно заменить более простым вычислением без потери качества на тестах. Но работа основана на препринте и сравнениях на бенчмарках, поэтому результат стоит воспринимать как перспективный, а не как готовое решение для практики.
Разбор
Авторы посмотрели на задачу объединения моделей как на проблему с «шумным» обратным вычислением: есть несколько дообученных моделей, и нужно собрать одну так, чтобы она не потеряла качество. Вместо длинной настройки шаг за шагом они сделали ставку на спектральный подход — то есть отдельно разобрали, какие направления в слоях модели важны, а какие только мешают и усиливают шум. Для этого они считают разложение матрицы по собственным направлениям, а потом по-разному ослабляют или отсекают слабые направления, которые и создают проблемы.
Главная идея статьи в том, что итеративные методы, которые раньше делали сотни шагов, выигрывали не потому, что «лучше оптимизируют», а потому, что сами собой отфильтровывают опасные направления с маленьким вкладом. Поэтому авторы предложили закрытую формулу SWUDI: она сочетает мягкое экспоненциальное сглаживание с жёстким обрезанием самых слабых направлений. Ещё есть вариант SWUDI-A, где порог подбирается отдельно для каждого слоя, чтобы не держаться за один общий гиперпараметр на всё сразу.
Что получилось на практике: на четырёх обычных бенчмарках и на мультимодальном наборе, где проверяли и ответы по картинкам, и геометрию, и таблицы, и OCR, и привязку объектов, эти методы не уступили лучшим итеративным решениям, а иногда и обошли их. При этом им не нужны ни данные для дообучения, ни состояние оптимизатора, то есть весь процесс становится заметно проще. Важная деталь: авторы ещё и добавили новый мультимодальный бенчмарк для проверки такого объединения — раньше, судя по тексту, именно здесь не хватало удобной общей проверки для разных типов моделей.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не прошло полноценное внешнее рецензирование. Сильная сторона работы — сравнение сразу на нескольких бенчмарках и в разных режимах объединения моделей, включая мультимодальный; слабое место — пока всё это проверяли в основном на тестах, а не в живой эксплуатации.
Пересказано ИИ по научной статье. Как это устроено