Препринт — материал ещё не прошёл рецензирование
Безобучаемый способ передаёт безопасность между моделями с разными словарями
Кратко
ALIGNBEAM — это метод для инференса, который переносит поведение безопасной модели на другую модель даже при разной лексике. В препринте его проверили на парах моделей и показали рост отказов на вредных запросах при сохранении качества задачи и умеренных накладных расходов.
Зачем это знать
Это может помочь защищать специализированные языковые модели без дообучения и без изменения весов. Но результаты пока относятся к конкретным парам моделей и бенчмаркам, поэтому прямой практический вывод для пользователей делать рано.
Разбор
Они взяли безопасную «якорную» модель и модель-специалист, которая после дообучения в своей области стала хуже реагировать на вредные запросы, и попробовали соединить их прямо во время генерации ответа. Смысл был в том, чтобы не трогать веса моделей и не переобучать их заново, а на каждом шаге подсказки для ответа аккуратно переводить сигнал безопасной модели в словарь второй модели. Если у моделей разные словари, это обычно ломает простые способы смешивания, поэтому здесь сначала выбирают наиболее вероятные токены у безопасной модели, переводят их в текст и затем снова кодируют уже через словарь целевой модели.
Дальше в игру входит небольшой судья на базе LLM: он сравнивает несколько кандидатных продолжений и оставляет самое безопасное. Это важно, потому что один только перенос вероятностей не всегда достаточно хорошо отделяет безвредный ответ от вредного. Авторы также сделали несколько вариантов этого «моста»: в одном случае они отбрасывали токены, которые не удавалось перевести один-к-одному, в другом оставляли только первый фрагмент, а в третьем были ещё осторожнее. Такой дизайн нужен, потому что при разной лексике часть слов распадается на несколько кусочков, и это надо как-то обработать на лету.
Интересный момент в том, что метод можно настраивать уже при запуске: один параметр двигает поведение ближе к безопасной модели или, наоборот, оставляет больше свободы основной модели. То есть это не «включил и забыл», а скорее ручка, которой можно подстроить баланс между безопасностью и качеством ответа под конкретную задачу. По данным статьи, такой подход срабатывал и на парах моделей с общим словарём, и на парах, где словари разные, что как раз и было главной проблемой для прежних методов.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не прошли независимую журнальную проверку. Проверяли метод на парах моделей и бенчмарках, а не в живом продукте, так что поведение в реальном развёртывании может быть менее стабильным и зависеть от конкретной связки моделей.
Пересказано ИИ по научной статье. Как это устроено