Препринт — материал ещё не прошёл рецензирование
Локальная проверка может не заметить распределённую лазейку в ИИ-системе
Кратко
Авторы разбирают, как в системе из нескольких ИИ-агентов вредоносная команда может быть разбита на безобидные части. Тогда проверка каждого шага по отдельности пропускает атаку, хотя в собранном виде она уже вредоносна. В одном из вариантов защита сработала только тогда, когда видела не отдельные фрагменты, а уже собранное представление.
Зачем это знать
Это показывает слабое место обычных встроенных проверок в сложных ИИ-системах: безопасность одной части ещё не гарантирует безопасность всей цепочки.
Разбор
Авторы смотрят не на одну ИИ-модель, а на цепочку из нескольких агентов, которые передают друг другу сообщения и пользуются инструментами. Идея проверки здесь простая: если каждый шаг по отдельности выглядит безопасным, значит и вся система в порядке. Исследование показывает, что это не так. Вредная команда может быть нарезана на куски так, что каждый кусок сам по себе выглядит безобидно, а опасность появляется только когда эти куски складываются вместе.
Чтобы разобраться, где именно ломается защита, авторы вводят понятие «границы наблюдаемости». По сути, это вопрос: что именно видит монитор — проверяющий слой — и может ли он по этому взгляду отличить атаку от обычного трафика. Если в том виде, в каком монитор смотрит на систему, фрагменты уже неотличимы от нормального поведения, то никакой, даже очень сильный, локальный детектор их не поймает. Проблема не в самом разбиении на части, а в том, что на уровне отдельных частей уже не остаётся полезных признаков атаки.
Дальше они проверяют это в нескольких условиях: на контролируемом тестовом стенде, на внешнем наборе примеров и в полных прогонах агентной системы. Картина везде одна и та же: как только локальные признаки исчезают, локальная защита теряет сигнал. Но если монитору показать не отдельные фрагменты, а уже собранное представление, атака снова становится видимой. То есть решает не просто «увидеть больше», а увидеть именно тот уровень представления, где вредоносная идея ещё читается как целое. Это и есть главный вывод работы: в составных ИИ-системах безопасность частей не складывается автоматически в безопасность всей цепочки.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не рецензировали другие учёные. Зато авторы не ограничились одной демонстрацией: они проверили идею на тестовом стенде, на внешнем наборе и в полных прогонах системы, что делает выводы гораздо убедительнее, чем один узкий пример. При этом часть результатов зависит от того, на каком именно уровне монитор «смотрит» на систему, так что перенос на другие архитектуры ещё нужно отдельно проверять.
Пересказано ИИ по научной статье. Как это устроено