Препринт — материал ещё не прошёл рецензирование
Тревожный и злой голос чаще обходил отказы аудио-ИИ
Кратко
Авторы проверили, как один и тот же текст в аудио с разной подачей влияет на ответы модели Qwen2-Audio. На наборе из 6 запросов тревожная, злая и быстрая подача заметно чаще обходила отказы, чем нейтральная: для одного запроса это было 38/95, 35/95 и 32/95 против 4/95.
Зачем это знать
Для аудио-ИИ важно учитывать не только слова, но и подачу голоса — темп, эмоции и интонацию. Это ранний результат для конкретных моделей, который показывает, что сама манера речи может влиять на проверки безопасности.
Разбор
Авторы не меняли сам текст запроса — они оставляли его одним и тем же, а потом по-разному озвучивали его в аудио. Для этого они собрали шесть вариантов подачи: с тревогой, злостью, быстрым темпом, авторитетной интонацией и другие близкие настройки, а затем проверяли, как на это отвечает аудиомодель Qwen2-Audio. Идея была простая: если модель умеет слушать не только слова, но и манеру речи, то именно в этой манере может скрываться новый путь обхода защит.
Чтобы сделать проверку аккуратнее, исследователи использовали два шага. Сначала они предложили протокол PJ-Break — по сути, набор правил для черного ящика, когда модель тестируют без доступа к ее внутренностям. Потом они собрали AdvAudio-Prosody — набор из 600 аудиопримеров, где акустические свойства голоса отдельно проверяли, чтобы не спутать эмоции, темп и подачу с случайными искажениями записи.
Самый сильный результат увидели на панели из 95 проверенных примеров для Qwen2-Audio: тревожная подача сработала в 38 случаях, злая — в 35, быстрая — в 32, а нейтральная только в 4. Кроме того, короткий набор из шести запросов дал 44 успешных обхода из 95 для Qwen2-Audio и 15 из 95 для GPT-4o. Еще важнее, что эффект не исчез, когда убрали один спорный тип подачи: даже без него набор все равно оставался сильным. Отдельная проверка показала, что эмоциональная аудиоподача работает заметно лучше, чем один только эмоциональный текст без голоса.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу еще не проверяли независимые рецензенты. Зато авторы использовали точные проверки на фиксированном наборе из 95 случаев и сравнивали несколько контролей, а не один удачный пример. При этом результаты пока относятся к конкретным моделям и сценариям аудиотестирования, так что переносить их на все аудио-ИИ стоит осторожно.
Пересказано ИИ по научной статье. Как это устроено