dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

BLUEPRINT обходил защиту шести моделей в 79,2% многошаговых атак

0

Кратко

Система BLUEPRINT проверила многоходовые атаки на шести языковых моделях: успешными оказались в среднем 79,2% попыток, а нужного результата удавалось достичь примерно за 2,46 обращения к модели. Чаще всего защита слабела, когда вредную просьбу превращали в конкретную задачу, которую модель могла сразу выполнить.

Зачем это знать

Для проверки безопасности важно учитывать не только отдельные опасные запросы: вредный смысл может постепенно проявиться в разговоре. При этом 79,2% — показатель успешности обхода защиты в тестовом наборе, а не частота вреда в реальном использовании; вывод пока относится к шести моделям, и его переносимость на другие системы не установлена.

Разбор

BLUEPRINT устроен как поиск по вариантам разговора. Сначала он выбирает приём влияния из набора, затем WORLDVIEWSIM поддерживает цельную сцену диалога: кто говорит, где происходит разговор, сколько времени прошло и почему просьба выглядит уместной. После каждого шага система проверяет ответ модели и решает, какой вариант развивать дальше. Для этого она использует поиск по дереву — перебирает много возможных продолжений и оставляет те, что дают лучший результат.

Авторы сделали такую конструкцию потому, что прежние методы часто смешивали две разные вещи: сам приём убеждения и правдоподобный контекст, в котором он появляется. Из-за этого было трудно понять, что именно ломает защиту. Здесь эти элементы разделили, а затем проверили на наборе HarmBench — стандартном тесте для оценки опасных запросов. Систему сравнили с несколькими другими подходами, и она заметно обошла их по средней доле успешных атак: у ближайшего соперника этот показатель составил 51,4%, а у BLUEPRINT — 79,2%.

Особенно интересен не общий результат, а различия между моделями. У одной системы успешными оказались все тестовые атаки, тогда как у другой — только 42,5%; значит, одинаковая стратегия не одинаково действует на разные модели. При этом устойчивые модели тоже поддавались, когда разговор переводил просьбу из области общих рассуждений в конкретную, выполнимую задачу. Дополнительные проверки показали: описание выгоды от действия часто усиливало атаку, а некоторые ссылки на законность или авторитет, наоборот, могли сработать против атакующего.

Ключевые цифры

18 факторовАвторы перебирали не пару случайных уловок, а широкий набор разных способов влиять на ход разговора.
4 ходаКаждую атаку ограничили коротким диалогом из четырёх последовательных шагов.
100%На двух из шести проверенных моделей система добилась успеха во всех тестовых случаях.
42,5%На самой устойчивой из показанных моделей сработало меньше половины атак, поэтому защита сильно зависела от конкретной системы.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Тестирование на шести моделях и стандартном наборе HarmBench выглядит содержательно, но этого недостаточно, чтобы судить о безопасности всех языковых моделей или о поведении в реальных разговорах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас3 сентября 2026 г.
Дата источника2 сентября 2026 г.
ОригиналОткрыть
АвторыSiyu Chen, Haoran Wang, Xiaojian Li, Yao Huang, Yinpeng Dong, Wei Xu