dumai
🤖
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

Выбор примеров менял успешность атаки на ИИ от 3% до 80%

0

Кратко

Авторы проверили атаки, где в обычные данные для дообучения добавляют специально подобранные вредные примеры: после появления условного сигнала модель должна выдать нужное атакующему поведение. В трёх сценариях на LLaMA-3-8B одинаковое число таких примеров давало успех от 3% до 80%, а предложенный способ выбора повысил результат ещё на 30 процентных пунктов в среднем.

Зачем это знать

Проверки, где вредные примеры выбирают случайно, могут занижать уязвимость ИИ. Это препринт, поэтому результат ещё не прошёл полноценную независимую проверку; кроме того, он относится к трём сценариям на одной модели и не показывает, как часто такие атаки происходят в реальных системах.

Разбор

Проблема здесь не только в том, сколько вредных примеров попало в набор для дообучения, но и в том, какие именно примеры туда попали. До этого такие проверки обычно брали фиксированное число примеров случайным образом из большого набора кандидатов. Авторы показали, что такой подход может пропустить гораздо более опасные варианты атаки: при одинаковой модели, чистых данных и количестве вредных примеров результат менялся только из-за состава выбранного набора.

Чтобы искать сильные комбинации, авторы представили задачу как перебор наборов при ограниченном числе дорогих проверок. Их метод SAILS сначала обучается на нескольких сотнях циклов «дообучить модель — измерить атаку», затем оценивает миллионы возможных наборов и отправляет на подробную проверку только небольшой список лучших кандидатов. Такой подход оказался полезен не только для одного типа поведения: он переносился с небольшого дообучения на полномасштабное и работал для генерации кода, автономных ИИ-агентов и атак через API.

Ключевые цифры

несколько сотен запусковСтолько пробных циклов понадобилось методу, чтобы научиться отличать перспективные наборы вредных примеров от слабых.
миллионы наборовАлгоритм мог быстро просеять огромное число комбинаций, хотя подробно проверял лишь небольшую часть из них.
3 сценарияВывод проверили не на одном типе атаки, а в трёх разных настройках, хотя все они относились к одной модели.

Можно ли доверять

Это препринт с arXiv, поэтому независимая проверка рецензентами ещё впереди. Авторы проверяли метод на трёх сценариях и одной модели LLaMA-3-8B; переносимость на другие модели и реальные системы пока остаётся открытым вопросом.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас15 сентября 2026 г.
Дата источника13 сентября 2026 г.
ОригиналОткрыть
АвторыAashiq Muhamed, Mona T. Diab, Virginia Smith, Andrew Ilyas, Matthew Jagielski