dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Безобучаемый способ передаёт безопасность между моделями с разными словарями

0

Кратко

ALIGNBEAM — это метод для инференса, который переносит поведение безопасной модели на другую модель даже при разной лексике. В препринте его проверили на парах моделей и показали рост отказов на вредных запросах при сохранении качества задачи и умеренных накладных расходов.

Зачем это знать

Это может помочь защищать специализированные языковые модели без дообучения и без изменения весов. Но результаты пока относятся к конкретным парам моделей и бенчмаркам, поэтому прямой практический вывод для пользователей делать рано.

Разбор

Они взяли безопасную «якорную» модель и модель-специалист, которая после дообучения в своей области стала хуже реагировать на вредные запросы, и попробовали соединить их прямо во время генерации ответа. Смысл был в том, чтобы не трогать веса моделей и не переобучать их заново, а на каждом шаге подсказки для ответа аккуратно переводить сигнал безопасной модели в словарь второй модели. Если у моделей разные словари, это обычно ломает простые способы смешивания, поэтому здесь сначала выбирают наиболее вероятные токены у безопасной модели, переводят их в текст и затем снова кодируют уже через словарь целевой модели.

Дальше в игру входит небольшой судья на базе LLM: он сравнивает несколько кандидатных продолжений и оставляет самое безопасное. Это важно, потому что один только перенос вероятностей не всегда достаточно хорошо отделяет безвредный ответ от вредного. Авторы также сделали несколько вариантов этого «моста»: в одном случае они отбрасывали токены, которые не удавалось перевести один-к-одному, в другом оставляли только первый фрагмент, а в третьем были ещё осторожнее. Такой дизайн нужен, потому что при разной лексике часть слов распадается на несколько кусочков, и это надо как-то обработать на лету.

Интересный момент в том, что метод можно настраивать уже при запуске: один параметр двигает поведение ближе к безопасной модели или, наоборот, оставляет больше свободы основной модели. То есть это не «включил и забыл», а скорее ручка, которой можно подстроить баланс между безопасностью и качеством ответа под конкретную задачу. По данным статьи, такой подход срабатывал и на парах моделей с общим словарём, и на парах, где словари разные, что как раз и было главной проблемой для прежних методов.

Ключевые цифры

KДля каждого шага метод не выбирает один вариант вслепую, а сравнивает несколько кандидатов ответа и оставляет самый безопасный.
B = 50Для переноса сигнала берут только 50 самых вероятных токенов безопасной модели, чтобы не тащить в расчёт всё подряд.
α ∈ [0,1]Это ручка настройки: можно сильнее опираться на безопасность или сильнее сохранять поведение основной модели.
> 98%На моделях с одинаковым словарём почти все токены удаётся сопоставить напрямую, поэтому там метод работает особенно гладко.

Можно ли доверять

Это препринт на arXiv, значит, работу ещё не прошли независимую журнальную проверку. Проверяли метод на парах моделей и бенчмарках, а не в живом продукте, так что поведение в реальном развёртывании может быть менее стабильным и зависеть от конкретной связки моделей.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыChirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu