dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Выравнивание внутренних представлений повысило устойчивость языковых моделей к замаскированным вредным запросам

0

Кратко

Авторы проверили 23 языковые модели на 251 334 человеческих оценках моральных ситуаций. Вместо обучения только готовым ответам они настроили внутренние представления — то, как модель кодирует смысл, — под человеческие моральные категории; в тестах это сделало модели устойчивее к разным способам замаскировать вредный запрос, хотя обычные ответы улучшились умеренно.

Зачем это знать

Результат указывает на возможное направление для дальнейшей разработки безопасных языковых моделей: важно проверять не только их ответы, но и то, как они распознают смысл. Пока это проверили на ограниченном наборе моделей и тестовых атак, поэтому перенос на реальные сценарии не показан.

Разбор

Авторы проверяли не только ответы моделей, но и то, как они группируют моральные ситуации по смыслу. Для этого использовали идею «прототипов»: внутри каждой категории есть типичные примеры, а новые случаи модель должна распознавать как более или менее похожие на них. Оказалось, что у современных моделей такая структура сохранена слабо: они нередко путали противоположные моральные категории и плохо различали, насколько типичен конкретный случай. Это наблюдалось и у моделей разного размера, и на разных этапах их настройки.

Затем исследователи сравнили два подхода на одних и тех же моральных оценках. Обычная настройка учила модель выдавать нужные ответы, но почти не меняла внутреннюю систему категорий; при проверке на замаскированных атаках это даже сопровождалось большей уязвимостью. Новый подход напрямую перестраивал внутренние представления — числовой способ, которым модель кодирует смысл, — чтобы они лучше соответствовали человеческому распознаванию моральных ситуаций. Явные ответы от этого улучшились скромнее, зато устойчивость выросла на разных размерах моделей, наборах проверок и способах атаки.

Можно ли доверять

Это препринт arXiv, поэтому независимая проверка рецензентами ещё впереди. Результат получен в экспериментах с языковыми моделями и тестовыми атаками, а не в реальном использовании; кроме того, абстракт не уточняет, насколько широко эти проверки покрывают возможные сценарии.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас4 сентября 2026 г.
Дата источника3 сентября 2026 г.
ОригиналОткрыть
АвторыLingyu Li, Yan Teng, Yingchun Wang, Xia Hu