dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Слабый случайный сигнал помогает различать тексты разных LLM

0

Кратко

В препринте на arXiv авторы показывают, что добавление редкого случайного вектора в внутренние активации LLM может создать детектируемый fingerprint ответа. По их данным, такой сигнал можно затем обнаружить и использовать для атрибуции текста конкретной модели, а также для различения нескольких LLM.

Зачем это знать

Работа интересна как предварительный пример того, что активации LLM можно использовать для атрибуции, но пока это именно препринт, а не проверенный практикой метод. Авторы также сами отмечают, что общий эффект и переносимость на другие модели ещё не ясны.

Разбор

Авторы не просто посмотрели на готовые ответы моделей, а вмешались прямо во время генерации: они слегка сдвигали внутренние активации модели с помощью редкого случайного вектора. Идея была в том, что такой маленький «след» можно встроить в текст так, чтобы потом другая модель или детектор смогли его заметить и понять, какой именно LLM это написал.

Для проверки они брали разные режимы генерации — от более предсказуемых ответов до длинных открытых продолжений — и сравнивали несколько моделей разного размера. Это важно, потому что раньше подобные идеи часто работали только в узких условиях, а тут авторы хотели понять, сохраняется ли сигнал, когда текст становится более естественным и разнообразным.

Самый интересный результат: сигнал действительно удавалось считывать из внутренних активаций другой LLM, и по их данным точность доходила до 98% и выше в нескольких сценариях. При этом качество текста почти не проседало, то есть модель не начинала заметно «ломаться» ради метки. По сути, они показали, что в активациях уже есть удобная структура, на которой можно построить атрибуцию текста без внешнего встраивания водяного знака.

Но есть важная оговорка из самой статьи: не все случайные векторы одинаково хороши. Одни сильнее портят ответ, другие лучше детектируются, и авторы прямо пишут, что ещё нужно понять, как этот эффект переносится на другие модели и можно ли надёжно масштабировать идею до более сложной схемы с несколькими битами кода.

Ключевые цифры

98%Детектор в большинстве тестов почти безошибочно узнавал, какой моделью был сгенерирован текст.
8BОсновные эксперименты делали на модели среднего размера, а не только на игрушечной маленькой версии.
1BАвторы также проверили, как метод ведёт себя на намного более компактной модели, чтобы понять, работает ли он в меньшем масштабе.

Можно ли доверять

Это препринт на arXiv, так что работу ещё не проверили независимые рецензенты. Хорошо, что авторы тестировали метод сразу на нескольких моделях и на разных типах задач, но часть выводов пока основана только на собственных экспериментах команды. Поэтому результаты выглядят убедительно как ранний сигнал, но для практического применения ещё нужны внешние проверки и испытания на других моделях.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас7 июня 2026 г.
Дата источника4 июня 2026 г.
ОригиналОткрыть
АвторыThibaud Ardoin, Jonas Schäfer, Gerhard Wunder