dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Водяные знаки для ИИ почти исчезают после простого пересказа

1

Кратко

Проверили три способа помечать текст, сгенерированный большими языковыми моделями: KGW, Unigram и SynthID-Text. На 846 удачных прогонов с 15 разными запросами смысловой пересказ почти всегда убирал метку: у KGW и Unigram — в 100% случаев, у SynthID — в 98,3%.

Зачем это знать

Это тревожный сигнал для тех, кто рассматривает такие метки как возможное доказательство: в нынешнем виде они слишком легко теряются. Для правил и инструментов проверки это показывает, что надёжность таких отметок ещё нужно заметно повышать.

Разбор

Авторы не просто посмотрели, можно ли найти метку в сгенерированном тексте. Они взяли три популярных подхода к водяным знакам и прогнали их через сценарий, который похож на реальную юридическую защиту: текст не переписывают вручную с нуля, а сохраняют смысл, но формулируют по-другому. Для этого они использовали парафраз — то есть смысловой пересказ, который оставляет содержание, но меняет слова и структуру. Именно такой тип правки для меток особенно неприятен, потому что его сложно отличить от обычного редактирования.

Дальше они проверили не только сами метки, но и то, как эти методы выглядят с точки зрения судебных требований к цифровым доказательствам. Для этого в работе использовали два ориентира: критерии допустимости доказательств в судах США и стандарт NIST для цифровой экспертизы. Параллельно авторы предложили свою рамку оценки — FRS, то есть систему баллов и обязательных проверок, которая должна показывать, насколько метод вообще пригоден для форензики. Это важно, потому что один и тот же алгоритм может выглядеть «достаточно хорошим» по баллам, но на практике проваливаться в ключевом месте.

Самый сильный результат как раз в этом: после смыслового пересказа метка почти всегда исчезала. Причём проблема была не только в атаках — даже до них у методов хватало промахов, когда система просто не видела собственную метку в уже водяном тексте. У SynthID, кроме этого, ещё и заметная часть человеческих текстов ошибочно считалась ИИ-текстом. Авторы отдельно отмечают, что их балльная схема FRS работает по правилам, но всё равно не умеет полностью поймать ситуацию, когда метод формально проходит проверки, а по сути для суда бесполезен. Это и есть главный контекст статьи: дело не в одном неудачном трюке, а в том, что сама идея «водяной знак = надёжное доказательство» пока не выдерживает жёсткой проверки.

Ключевые цифры

846Столько успешных прогонов пересказа авторы смогли собрать для сравнения — это уже не случайный сбой, а устойчивая картина.
15Методы проверяли на 15 разных запросах, так что результат не привязан к одному удачному или неудачному примеру.
100%Для KGW и Unigram после пересказа не осталось ни одной обнаруживаемой метки — в суде на такую отметку уже не опереться.
98,3%Даже у SynthID почти все метки исчезали после обычного смыслового пересказа, то есть защита держалась крайне слабо.

Можно ли доверять

Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Но эксперимент выглядит серьёзно: авторы сравнили сразу три метода и проверяли их на множестве прогонов, а не на одном-двух примерах. При этом они тестировали open-source реализацию SynthID, а не закрытую версию Google, поэтому к результатам по этому методу стоит относиться именно как к проверке конкретной реализации.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас20 июля 2026 г.
Дата источника17 июля 2026 г.
ОригиналОткрыть
АвторыSaifur Rahman Tamim, Amir Labib Khan