Препринт — материал ещё не прошёл рецензирование
У ИИ могут быть различия без человеческих названий
Кратко
Авторы предлагают искать в языковых моделях внутренние различия, которые можно воспроизводимо находить, описывать и связывать с поведением, даже если человек не понимает их смысла. Работа в основном формулирует направление экспериментов, а не сообщает о подробно проверенных результатах.
Зачем это знать
Такой подход напоминает: понятные человеку качества вроде честности или обмана могут описывать не всё, что происходит внутри ИИ. Это особенно важно для безопасности, если внутренние различия влияют на поведение, оставаясь невидимыми в обычных объяснениях.
Разбор
Авторы предлагают разделить две задачи, которые часто смешивают. Сначала можно установить, что внутри модели есть устойчивое различие: найти его с помощью зондов и анализа активаций, проверить геометрию этого различия, а затем вмешаться в него — например, изменить или выключить соответствующий сигнал — и посмотреть, меняется ли поведение модели. Для этого не обязательно сразу понимать, что именно означает найденная структура.
Это важно потому, что привычные объяснения вроде «модель честная» или «модель обманывает» заранее подгоняют внутреннюю работу ИИ под человеческие категории. Авторы считают, что набор возможных различий внутри модели намного богаче любого конечного набора слов и понятий, которым располагают люди. Поэтому они предлагают искать не только знакомые качества, но и такие устойчивые внутренние схемы, которым пока нельзя дать точное человеческое название.
В качестве основы для будущих экспериментов описываются несколько проверок: повторно находить один и тот же сигнал на разных примерах, сравнивать его с последующими вычислениями и измерять эффект вмешательства на поведение. При этом авторы отдельно предупреждают: если внутренний признак связан с понятным свойством на входе, это ещё не доказывает, что он действительно управляет вычислением. В качестве примера они приводят результаты, согласно которым некоторые признаки, найденные разреженными автоэнкодерами, могут хорошо коррелировать с понятными особенностями данных, но слабо влиять на работу модели при вмешательстве. Таким образом, статья задаёт программу проверки, а не предъявляет готовый каталог «чуждых» человеку смыслов.
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая рецензирование. Кроме того, работа в основном предлагает понятия и план экспериментов; по приведённому материалу нельзя оценить их надёжность на большой выборке реальных моделей и задач. Важно и то, что даже воспроизводимый эффект вмешательства ещё не гарантирует, что его смысл удастся однозначно понять.
Пересказано ИИ по научной статье. Как это устроено