Препринт — материал ещё не прошёл рецензирование
Одна ИИ-модель создаёт речь, музыку и звуковые эффекты
Кратко
StepAudio 3 Gen объединяет в одной системе создание речи по тексту, новых голосов, вокала, музыки и звуковых эффектов, а также их сочетаний. Авторы технического отчёта заявляют передовые результаты для речи и создания голосов, однако не приводят в кратком описании численных сравнений с другими моделями.
Зачем это знать
Если эти возможности подтвердятся, один инструмент сможет работать с разными видами аудио вместо отдельных систем для речи, музыки и эффектов. Пока это ранний результат без подробных измерений, поэтому его предстоит независимо проверить.
Разбор
Авторы собрали модель не вокруг отдельных генераторов для каждого типа звука, а вокруг общего способа описания аудио. Сначала звук превращают в последовательность дискретных кодов — коротких условных «кусочков» информации о смысле и звучании. Затем большая языковая модель предсказывает эту последовательность: сначала основной слой кодов по времени, а небольшой дополнительный Transformer достраивает детали. Такой подход отличается от распространённого варианта, где звук генерируют постепенно из непрерывного шума с помощью диффузионной модели.
Главная техническая проблема здесь — совместить очень разные задачи и при этом не потерять уже имеющиеся у языковой модели способности работать с текстом. Для этого авторы сначала обучали систему постепенно, добавляя аудиовозможности так, чтобы они меньше мешали текстовым, а затем использовали обучение на инструкциях и дообучение на размеченных примерах. Отдельный модуль RVQ Adaptor помогает модели работать сразу с несколькими слоями аудиокодов, а единое представление позволяет смешивать в одном запросе разные виды звука.
По заявлению авторов, система показала лучшие результаты в задачах создания речи и проектирования голоса, сохранив сильную генерацию вокала, музыки и эффектов. Но в самом абстракте нет таблиц, численных значений и подробного описания тестов, поэтому это заявление нельзя проверить по одному тексту статьи. Примеры аудио авторы вынесли на отдельную веб-страницу.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не рецензированная журнальная публикация, поэтому независимой проверки методики ещё не было. В абстракте не указаны размер тестовых наборов и численные сравнения с другими моделями; кроме того, заявленные результаты основаны на оценке самой команды авторов.
Пересказано ИИ по научной статье. Как это устроено