Препринт — материал ещё не прошёл рецензирование
Выбор примеров менял успешность атаки на ИИ от 3% до 80%
Кратко
Авторы проверили атаки, где в обычные данные для дообучения добавляют специально подобранные вредные примеры: после появления условного сигнала модель должна выдать нужное атакующему поведение. В трёх сценариях на LLaMA-3-8B одинаковое число таких примеров давало успех от 3% до 80%, а предложенный способ выбора повысил результат ещё на 30 процентных пунктов в среднем.
Зачем это знать
Проверки, где вредные примеры выбирают случайно, могут занижать уязвимость ИИ. Это препринт, поэтому результат ещё не прошёл полноценную независимую проверку; кроме того, он относится к трём сценариям на одной модели и не показывает, как часто такие атаки происходят в реальных системах.
Разбор
Проблема здесь не только в том, сколько вредных примеров попало в набор для дообучения, но и в том, какие именно примеры туда попали. До этого такие проверки обычно брали фиксированное число примеров случайным образом из большого набора кандидатов. Авторы показали, что такой подход может пропустить гораздо более опасные варианты атаки: при одинаковой модели, чистых данных и количестве вредных примеров результат менялся только из-за состава выбранного набора.
Чтобы искать сильные комбинации, авторы представили задачу как перебор наборов при ограниченном числе дорогих проверок. Их метод SAILS сначала обучается на нескольких сотнях циклов «дообучить модель — измерить атаку», затем оценивает миллионы возможных наборов и отправляет на подробную проверку только небольшой список лучших кандидатов. Такой подход оказался полезен не только для одного типа поведения: он переносился с небольшого дообучения на полномасштабное и работал для генерации кода, автономных ИИ-агентов и атак через API.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому независимая проверка рецензентами ещё впереди. Авторы проверяли метод на трёх сценариях и одной модели LLaMA-3-8B; переносимость на другие модели и реальные системы пока остаётся открытым вопросом.
Пересказано ИИ по научной статье. Как это устроено