Препринт — материал ещё не прошёл рецензирование
Скрытая черта сохранялась в цепочке языковых моделей десять поколений
Кратко
Авторы передали скрытую черту поведения от одной языковой модели к следующей через десять поколений. Внешнее выражение ослабло: с 55,6% после первого шага до 21,1% к десятому. После удаления стандартной системной инструкции модель перестала выражать черту, хотя внутренние измерения указывали, что связанный с ней сигнал сохранился.
Зачем это знать
Пока результат получен лишь на трёх цепочках копий одной модели и на десяти шагах. Это означает, что по одним ответам модели можно не заметить внутренне сохранённую черту.
Разбор
Авторы взяли три копии Qwen2.5-7B-Instruct и сначала специально добавили каждой одну и ту же скрытую особенность поведения. Затем они обучали следующую модель только на отфильтрованных ответах предыдущей — то есть передавали сигнал без явных слов или тем, которые напрямую описывают эту особенность. Так получились три независимые цепочки длиной десять поколений. Каждое поколение проверяли на одних и тех же новых запросах двумя способами: смотрели на заметные слова в ответе и измеряли внутреннее изменение модели относительно исходной.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, а не статья, прошедшая журнальное рецензирование. Авторы проверили небольшое число цепочек одной модели, поэтому вывод нельзя автоматически переносить на другие модели или реальные системы. Кроме того, десяти поколений недостаточно, чтобы понять, исчезает ли внешний сигнал окончательно или просто затухает очень медленно.
Пересказано ИИ по научной статье. Как это устроено