Препринт — материал ещё не прошёл рецензирование
Слабый случайный сигнал помогает различать тексты разных LLM
Кратко
В препринте на arXiv авторы показывают, что добавление редкого случайного вектора в внутренние активации LLM может создать детектируемый fingerprint ответа. По их данным, такой сигнал можно затем обнаружить и использовать для атрибуции текста конкретной модели, а также для различения нескольких LLM.
Зачем это знать
Работа интересна как предварительный пример того, что активации LLM можно использовать для атрибуции, но пока это именно препринт, а не проверенный практикой метод. Авторы также сами отмечают, что общий эффект и переносимость на другие модели ещё не ясны.
Разбор
Авторы не просто посмотрели на готовые ответы моделей, а вмешались прямо во время генерации: они слегка сдвигали внутренние активации модели с помощью редкого случайного вектора. Идея была в том, что такой маленький «след» можно встроить в текст так, чтобы потом другая модель или детектор смогли его заметить и понять, какой именно LLM это написал.
Для проверки они брали разные режимы генерации — от более предсказуемых ответов до длинных открытых продолжений — и сравнивали несколько моделей разного размера. Это важно, потому что раньше подобные идеи часто работали только в узких условиях, а тут авторы хотели понять, сохраняется ли сигнал, когда текст становится более естественным и разнообразным.
Самый интересный результат: сигнал действительно удавалось считывать из внутренних активаций другой LLM, и по их данным точность доходила до 98% и выше в нескольких сценариях. При этом качество текста почти не проседало, то есть модель не начинала заметно «ломаться» ради метки. По сути, они показали, что в активациях уже есть удобная структура, на которой можно построить атрибуцию текста без внешнего встраивания водяного знака.
Но есть важная оговорка из самой статьи: не все случайные векторы одинаково хороши. Одни сильнее портят ответ, другие лучше детектируются, и авторы прямо пишут, что ещё нужно понять, как этот эффект переносится на другие модели и можно ли надёжно масштабировать идею до более сложной схемы с несколькими битами кода.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не проверили независимые рецензенты. Хорошо, что авторы тестировали метод сразу на нескольких моделях и на разных типах задач, но часть выводов пока основана только на собственных экспериментах команды. Поэтому результаты выглядят убедительно как ранний сигнал, но для практического применения ещё нужны внешние проверки и испытания на других моделях.
Пересказано ИИ по научной статье. Как это устроено