Препринт — материал ещё не прошёл рецензирование
BLUEPRINT обходил защиту шести моделей в 79,2% многошаговых атак
Кратко
Система BLUEPRINT проверила многоходовые атаки на шести языковых моделях: успешными оказались в среднем 79,2% попыток, а нужного результата удавалось достичь примерно за 2,46 обращения к модели. Чаще всего защита слабела, когда вредную просьбу превращали в конкретную задачу, которую модель могла сразу выполнить.
Зачем это знать
Для проверки безопасности важно учитывать не только отдельные опасные запросы: вредный смысл может постепенно проявиться в разговоре. При этом 79,2% — показатель успешности обхода защиты в тестовом наборе, а не частота вреда в реальном использовании; вывод пока относится к шести моделям, и его переносимость на другие системы не установлена.
Разбор
BLUEPRINT устроен как поиск по вариантам разговора. Сначала он выбирает приём влияния из набора, затем WORLDVIEWSIM поддерживает цельную сцену диалога: кто говорит, где происходит разговор, сколько времени прошло и почему просьба выглядит уместной. После каждого шага система проверяет ответ модели и решает, какой вариант развивать дальше. Для этого она использует поиск по дереву — перебирает много возможных продолжений и оставляет те, что дают лучший результат.
Авторы сделали такую конструкцию потому, что прежние методы часто смешивали две разные вещи: сам приём убеждения и правдоподобный контекст, в котором он появляется. Из-за этого было трудно понять, что именно ломает защиту. Здесь эти элементы разделили, а затем проверили на наборе HarmBench — стандартном тесте для оценки опасных запросов. Систему сравнили с несколькими другими подходами, и она заметно обошла их по средней доле успешных атак: у ближайшего соперника этот показатель составил 51,4%, а у BLUEPRINT — 79,2%.
Особенно интересен не общий результат, а различия между моделями. У одной системы успешными оказались все тестовые атаки, тогда как у другой — только 42,5%; значит, одинаковая стратегия не одинаково действует на разные модели. При этом устойчивые модели тоже поддавались, когда разговор переводил просьбу из области общих рассуждений в конкретную, выполнимую задачу. Дополнительные проверки показали: описание выгоды от действия часто усиливало атаку, а некоторые ссылки на законность или авторитет, наоборот, могли сработать против атакующего.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Тестирование на шести моделях и стандартном наборе HarmBench выглядит содержательно, но этого недостаточно, чтобы судить о безопасности всех языковых моделей или о поведении в реальных разговорах.
Пересказано ИИ по научной статье. Как это устроено