dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Атака через API извлекает скрытые рассуждения некоторых ИИ-моделей

0

Кратко

Авторы проверили способ извлечения скрытого хода мыслей через последовательность запросов к API у восьми моделей: трёх открытых и пяти закрытых. У открытых моделей успех достигал 66,4–80%, а у Gemini-2.5 удалось получить 33 463 токена — фрагмента текста — из 32 948 целевых.

Зачем это знать

Это указывает на практический риск утечки внутренних рассуждений ИИ-систем. Но работа пока является препринтом, а результат относится к конкретным моделям и одному сценарию взаимодействия: он не доказывает, что так уязвимы все подобные системы.

Разбор

Авторы искали не способ заставить модель просто написать правдоподобное объяснение, а возможность восстановить именно её внутренний текст рассуждений — почти дословно. Они заметили малоизученное место в работе ИИ с инструментами: по ответам API можно получить сигналы о том, насколько новый запрос похож на предыдущий ход рассуждений. На этом построили EchoCoT — атаку из нескольких шагов, которая постепенно подбирает запросы и использует ответ модели как обратную связь.

Чтобы не подбирать такие запросы вручную для каждой задачи, исследователи обучили отдельный языковой оптимизатор искать универсальную последовательность вставок. Для этого он видел только условие задачи и доступные атакующему сведения: число токенов рассуждения и его краткое резюме, но не саму скрытую цепочку. Проверка охватывала задачи по математике, программированию, химии и биологии; затем авторы сравнили метод с прямой просьбой раскрыть ход решения и несколькими способами восстановить его по косвенным признакам.

Особенно важно, что найденная последовательность запросов переносилась на задачи, которых не было при настройке. При строгом критерии успеха текст должен был быть почти такой же длины, как исходный, а не менее 90% его токенов — совпадать буквально. Это отличает результат от обычной генерации убедительного объяснения: речь идёт о совпадении с конкретным внутренним следом модели. При этом для закрытых систем авторы не могли проверить каждый токен напрямую, поэтому сопоставляли извлечённые фрагменты с длиной рассуждения и резюме, которые сообщал поставщик.

Ключевые цифры

K = 3Атака укладывается максимум в три шага взаимодействия с моделью, поэтому это не бесконечный перебор запросов.
540 вопросовНа таком наборе подбирали универсальную последовательность запросов, а не настраивали её отдельно под каждую задачу.
360 вопросовОтдельный набор без пересечения с предыдущим проверял, работает ли найденный способ на новых задачах.
90% токеновДля строгого признания успеха почти весь восстановленный текст должен был буквально совпасть с исходным рассуждением.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая независимое рецензирование. Проверка выглядит содержательной: авторы использовали несколько открытых и закрытых моделей, разные области задач и отдельные наборы для проверки переноса, но для закрытых моделей точность восстановления нельзя подтвердить по каждому токену — там вывод делали по косвенным признакам вроде длины и резюме рассуждения.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас21 августа 2026 г.
Дата источника20 августа 2026 г.
ОригиналОткрыть
АвторыYiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang