Препринт — материал ещё не прошёл рецензирование
RLHF сглаживает политические ответы, не стирая партийный сигнал
Кратко
В препринте на модели Llama 3.1 8B авторы сравнили внутренние представления до и после RLHF и нашли, что структурный партийный сигнал сохраняется. При этом его вклад в генерацию как будто сжимается: модель чаще выдаёт ровные, нейтральные ответы, а не «удаляет» саму партийность.
Зачем это знать
Это помогает понять, что RLHF может менять поведение модели без полного переписывания внутренних представлений. Но по этому механистическому результату на одной модели нельзя делать прямые выводы о других моделях, тем более о практических рекомендациях для пользователей.
Разбор
Авторы не просто посмотрели, как модель отвечает на политические вопросы, а заглянули в то, что происходит внутри неё до ответа и после RLHF — того самого этапа дообучения на человеческих предпочтениях. Для этого они сравнили базовую Llama 3.1 8B и её версию Instruct, то есть модель после RLHF, и искали, осталась ли внутри следовая «направленность» в сторону одной из партий или она исчезла совсем.
Главный ход тут в том, что они анализировали внутренние представления модели, а не только готовый текст. Чтобы понять, где именно живёт политический сигнал, авторы использовали разложение с помощью разреженного автоэнкодера — по-простому, это способ разложить скрытые внутренние признаки модели на отдельные кусочки и посмотреть, какие из них включаются на политически окрашенный контент. Так они увидели, что сама структура партийного сигнала в базовой модели никуда не девается после RLHF.
Но RLHF меняет не наличие этого сигнала, а его роль в генерации. Внутри модели политическая ориентация остаётся, однако путь от этого внутреннего слоя к ответу как будто разрывается: модель начинает чаще выдавать ровные, сбалансированные и нейтральные формулировки. При этом часть признаков, связанных с политическими позициями, в Instruct-модели вообще перестаёт срабатывать, а эксперименты с управлением этими признаками показали, что связь между внутренним сигналом и текстом действительно стала слабее.
Авторы ещё показали важную деталь: такую «нейтральность» можно обойти. Если заставить модель угадывать или усиливать партийную принадлежность пользователя, то партийные ответы снова всплывают. Это и есть их ключевой вывод: RLHF не стирает политическое знание, а скорее учит модель не пускать его в обычный ответ.
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли внешние рецензенты. Проверка сделана на одной модели — Llama 3.1 8B — и на одном политическом домене, поэтому результат хорошо показывает механизм, но не доказывает, что так же ведут себя все модели и все типы ценностей.
Пересказано ИИ по научной статье. Как это устроено