Препринт — материал ещё не прошёл рецензирование
Вставка сценариев помогает обходить отказы ИИ-моделей
Кратко
Авторы предложили способ Concept2Scenario, который находит естественные сценарии, из-за которых безопасно настроенные языковые модели чаще перестают отказывать на вредные запросы. На трёх открытых моделях и шести способах атаки такие сценарии повысили успешность атак до 18,2 процентного пункта; часть из них сработала и на GPT-5, Claude-Haiku-4.5 и Gemini-3-Flash.
Зачем это знать
Это значит, что проверять защиту нужно не только на отдельных запросах, но и на запросах в разных жизненных сценариях.
Разбор
Авторы сначала проверили идею не только на внешнем поведении модели, но и заглянули внутрь неё: они подали в модель сценарии, обёрнутые вокруг вредных запросов, и посмотрели, какие внутренние «направления» активности при этом включаются. Потом они сделали следующий шаг: нашли такие внутренние признаки, которые не просто сопровождают отказ, а именно уменьшают его, то есть как будто подталкивают модель отвечать вместо того, чтобы отказываться.
На этой основе они собрали Concept2Scenario — схему, которая берёт абстрактный внутренний признак и переводит его в понятный текстовый сценарий. Для этого использовали разреженный автоэнкодер — это способ выделить из огромного потока сигналов только те редкие и заметные элементы, которые реально влияют на поведение модели. Затем они приписывали снижение отказов отдельным концептам, превращали их в естественные сценарии и отдельно искали удачные сочетания сценариев, потому что вместе они оказывались сильнее, чем по одному.
Самый интересный результат в том, что такие сценарии работали не как разовые трюки, а как повторно используемые «подсказки» для атак. На трёх открытых моделях, двух наборах для проверки безопасности и шести чёрноящичных методах обхода защиты они заметно повышали успешность атак, а часть найденных сценариев переносилась и на закрытые модели других семейств. Ещё одна деталь: комбинации сценариев помогали быстрее доводить многошаговые атаки до успеха, то есть экономили количество попыток.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не оценили независимые рецензенты. Но авторы проверили подход на нескольких открытых моделях, двух бенчмарках и шести способах атаки, а ещё показали перенос на GPT-5, Claude-Haiku-4.5 и Gemini-3-Flash — для такой темы это сильный набор проверок. При этом часть результатов получена на чёрноящичных атаках, так что в реальном использовании эффект может гулять.
Пересказано ИИ по научной статье. Как это устроено