Препринт — материал ещё не прошёл рецензирование
Водяные знаки для ИИ почти исчезают после простого пересказа
Кратко
Проверили три способа помечать текст, сгенерированный большими языковыми моделями: KGW, Unigram и SynthID-Text. На 846 удачных прогонов с 15 разными запросами смысловой пересказ почти всегда убирал метку: у KGW и Unigram — в 100% случаев, у SynthID — в 98,3%.
Зачем это знать
Это тревожный сигнал для тех, кто рассматривает такие метки как возможное доказательство: в нынешнем виде они слишком легко теряются. Для правил и инструментов проверки это показывает, что надёжность таких отметок ещё нужно заметно повышать.
Разбор
Авторы не просто посмотрели, можно ли найти метку в сгенерированном тексте. Они взяли три популярных подхода к водяным знакам и прогнали их через сценарий, который похож на реальную юридическую защиту: текст не переписывают вручную с нуля, а сохраняют смысл, но формулируют по-другому. Для этого они использовали парафраз — то есть смысловой пересказ, который оставляет содержание, но меняет слова и структуру. Именно такой тип правки для меток особенно неприятен, потому что его сложно отличить от обычного редактирования.
Дальше они проверили не только сами метки, но и то, как эти методы выглядят с точки зрения судебных требований к цифровым доказательствам. Для этого в работе использовали два ориентира: критерии допустимости доказательств в судах США и стандарт NIST для цифровой экспертизы. Параллельно авторы предложили свою рамку оценки — FRS, то есть систему баллов и обязательных проверок, которая должна показывать, насколько метод вообще пригоден для форензики. Это важно, потому что один и тот же алгоритм может выглядеть «достаточно хорошим» по баллам, но на практике проваливаться в ключевом месте.
Самый сильный результат как раз в этом: после смыслового пересказа метка почти всегда исчезала. Причём проблема была не только в атаках — даже до них у методов хватало промахов, когда система просто не видела собственную метку в уже водяном тексте. У SynthID, кроме этого, ещё и заметная часть человеческих текстов ошибочно считалась ИИ-текстом. Авторы отдельно отмечают, что их балльная схема FRS работает по правилам, но всё равно не умеет полностью поймать ситуацию, когда метод формально проходит проверки, а по сути для суда бесполезен. Это и есть главный контекст статьи: дело не в одном неудачном трюке, а в том, что сама идея «водяной знак = надёжное доказательство» пока не выдерживает жёсткой проверки.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, так что работу ещё не проверяли независимые рецензенты. Но эксперимент выглядит серьёзно: авторы сравнили сразу три метода и проверяли их на множестве прогонов, а не на одном-двух примерах. При этом они тестировали open-source реализацию SynthID, а не закрытую версию Google, поэтому к результатам по этому методу стоит относиться именно как к проверке конкретной реализации.
Пересказано ИИ по научной статье. Как это устроено