Препринт — материал ещё не прошёл рецензирование
GUARD учит ИИ не раскрывать опасные сведения и связно отказывать
Кратко
Метод учит языковую модель после опасного запроса не раскрывать защищённые сведения, а последовательно переходить к отказу. На двух моделях и тестовых наборах такой подход реже допускал утечки и сохранял полезность рассуждений по сравнению с другими методами.
Зачем это знать
Подход проверили только на двух моделях и специальных тестах, поэтому его надёжность для реальных систем пока неясна. Идея задаёт способ сделать отказ ИИ более связным, не подменяя забытые сведения неподкреплёнными выдумками.
Разбор
Проблема здесь не только в том, чтобы удалить из модели запрещённый факт. У рассуждающей модели этот факт может появиться внутри промежуточной цепочки рассуждений ещё до финального ответа. Если просто подавить такую цепочку, модель иногда начинает выдумывать замену, обрывает текст в странном месте или зацикливается. Авторы решили заранее задать, как должно выглядеть «естественное забывание»: рассуждение не раскрывает сведения, а затем заканчивается устойчивым и понятным отказом.
GUARD работает в три шага. Сначала авторы берут опасные ответы модели и переписывают их в безопасные траектории — последовательности от рассуждения до финального ответа. Затем с помощью коротких специальных подсказок-направляющих находят для замороженной модели безопасный способ продолжать текст. Наконец, это поведение переносят в параметры отдельной модели, чтобы безопасный выход не зависел от ручного добавления подсказок при каждом запросе.
Авторы также предложили отдельную проверку качества забывания — NFRS. Она оценивает не только то, просочился ли запрещённый факт, но и выглядит ли ответ связно, стабильно и без неподтверждённой выдумки. Это важно, потому что низкая утечка сама по себе может означать не грамотный отказ, а поломку ответа. На наборах R-TOFU и сценарии вредоносных запросов на основе STAR-1 метод сравнивали с другими подходами на двух моделях и отдельно проверяли, сохраняется ли способность решать обычные задачи рассуждения.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая независимое рецензирование. Проверка прошла на двух дистиллированных моделях и специальных тестовых наборах, а не на широком потоке реальных пользователей; поэтому устойчивость к новым формулировкам запросов и другим архитектурам ещё предстоит подтвердить.
Пересказано ИИ по научной статье. Как это устроено