Препринт — материал ещё не прошёл рецензирование
Незаметные детали запроса могут сильно менять ответы ИИ
Кратко
В опытах с разными языковыми моделями отдельные перефразировки и опечатки почти не меняли ответы. Но вместе такие мелкие детали могли сильно направлять поведение модели, причём их сочетание могло сработать и на другой модели.
Зачем это знать
Если результат подтвердится, безопасность ИИ придётся оценивать не только по смыслу запроса, но и по незаметным изменениям текста. Пока это ранний сигнал: работа не показывает, как часто такой эффект возникает в обычном использовании.
Разбор
Авторы не искали одну «магическую» фразу. Они разбирали запрос на отдельные места, куда можно подставить обычные варианты текста: например, перефразировку, опечатку или другой формат записи. Затем проверяли, как меняется вероятность каждого ответа, и подбирали сочетания слабых сигналов, которые вместе дают сильный перекос. Такой подход помогает отличить случайный каприз модели от устойчивого эффекта накопления.
В дополнительных тестах этот приём применяли не только к отвлечённым ответам вроде выбора между двумя цифрами. С его помощью пытались направлять ответы на моральную дилемму и вопрос о сознании модели. Для описания результата авторы использовали аддитивную модель: она оценивает, насколько хорошо сумма небольших влияний предсказывает итоговый сдвиг ответа. Это важно, потому что эффект можно измерять системно, а не показывать лишь отдельные удачные примеры.
Авторы также проверяли, сохраняется ли найденная закономерность при переносе на другую модель. Если набор незаметных текстовых сигналов работает не только там, где его обнаружили, это усложняет интерпретацию поведения ИИ: исследователь может не заметить причину ответа, даже когда она находится в самом тексте запроса. Раньше подобные проверки обычно сосредотачивались на явных инструкциях или заметных изменениях смысла, а здесь внимание сместили на накопление мелких отличий.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому работу ещё не проверили независимые рецензенты. Авторы тестировали эффект на моделях, а не на людях или в реальных пользовательских сценариях; кроме того, в доступном абстракте нет подробностей о размере всех экспериментов, поэтому частоту явления в обычных запросах оценить нельзя.
Пересказано ИИ по научной статье. Как это устроено