dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

GUARD учит ИИ не раскрывать опасные сведения и связно отказывать

0

Кратко

Метод учит языковую модель после опасного запроса не раскрывать защищённые сведения, а последовательно переходить к отказу. На двух моделях и тестовых наборах такой подход реже допускал утечки и сохранял полезность рассуждений по сравнению с другими методами.

Зачем это знать

Подход проверили только на двух моделях и специальных тестах, поэтому его надёжность для реальных систем пока неясна. Идея задаёт способ сделать отказ ИИ более связным, не подменяя забытые сведения неподкреплёнными выдумками.

Разбор

Проблема здесь не только в том, чтобы удалить из модели запрещённый факт. У рассуждающей модели этот факт может появиться внутри промежуточной цепочки рассуждений ещё до финального ответа. Если просто подавить такую цепочку, модель иногда начинает выдумывать замену, обрывает текст в странном месте или зацикливается. Авторы решили заранее задать, как должно выглядеть «естественное забывание»: рассуждение не раскрывает сведения, а затем заканчивается устойчивым и понятным отказом.

GUARD работает в три шага. Сначала авторы берут опасные ответы модели и переписывают их в безопасные траектории — последовательности от рассуждения до финального ответа. Затем с помощью коротких специальных подсказок-направляющих находят для замороженной модели безопасный способ продолжать текст. Наконец, это поведение переносят в параметры отдельной модели, чтобы безопасный выход не зависел от ручного добавления подсказок при каждом запросе.

Авторы также предложили отдельную проверку качества забывания — NFRS. Она оценивает не только то, просочился ли запрещённый факт, но и выглядит ли ответ связно, стабильно и без неподтверждённой выдумки. Это важно, потому что низкая утечка сама по себе может означать не грамотный отказ, а поломку ответа. На наборах R-TOFU и сценарии вредоносных запросов на основе STAR-1 метод сравнивали с другими подходами на двух моделях и отдельно проверяли, сохраняется ли способность решать обычные задачи рассуждения.

Ключевые цифры

3 этапаМетод не просто штрафует утечку: он создаёт безопасную траекторию, находит для неё рабочую настройку и затем встраивает поведение в модель.
2 моделиРезультат получили не на одной конкретной системе, хотя такой масштаб всё ещё недостаточен, чтобы судить о надёжности метода для всех языковых моделей.
5% R-TOFUВ дополнительной проверке авторы использовали лишь пять процентов набора R-TOFU для анализа настроек метода, то есть это не размер всей основной оценки.
8B параметровОдин из показанных экспериментов проводили на модели с восемью миллиардами параметров — достаточно крупной, но не равной самым большим коммерческим системам.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая независимое рецензирование. Проверка прошла на двух дистиллированных моделях и специальных тестовых наборах, а не на широком потоке реальных пользователей; поэтому устойчивость к новым формулировкам запросов и другим архитектурам ещё предстоит подтвердить.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас21 сентября 2026 г.
Дата источника18 сентября 2026 г.
ОригиналОткрыть
АвторыZeyu Yan, Guanghao Zhou, Minghui Qiu, Ming Gao, Cen Chen