dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

PRISM извлекает инструкции из скрытых состояний языковой модели

0

Кратко

PRISM — это интерпретатор, который по активациям модели пытается восстановить набор действующих инструкций. В препринте на arXiv он лучше базовых подходов переводил скрытые состояния в список инструкций в обычных, ограниченных, уязвимых к инъекциям и скрытых сценариях.

Зачем это знать

Это может помочь лучше понимать, какие указания реально ведут поведение агентных LLM. Но пока это лишь препринт и сравнение с бенчмарками, так что выводы стоит воспринимать как ранние.

Разбор

Авторы не просто пытались угадать «о чём думает» языковая модель, а поставили более узкую задачу: восстановить список активных инструкций, которые прямо сейчас направляют ответ модели. Для этого они берут короткий кусок скрытых состояний модели — внутренние числовые сигналы, которые обычно не видны пользователю, — и учат отдельный интерпретатор превращать их в понятный человеку список пунктов: что нужно сделать, чего избегать и какие подзадачи держать в голове.

Главная новизна в том, что PRISM обучали не просто на совпадение текста, а на качество самого списка. Сначала его настраивали на размеченных примерах, а потом дообучали с помощью другой модели-судьи, которая проверяла две вещи: покрыты ли все важные инструкции и не добавил ли интерпретатор лишнего. Это важно, потому что старые методы «от активаций к тексту» обычно хорошо пересказывают общий смысл, но не умеют аккуратно восстанавливать полный набор одновременно действующих указаний — а в агентных сценариях именно это и нужно.

Проверяли PRISM в нескольких режимах: на обычных запросах, на задачах с жёсткими ограничениями, в ситуациях с prompt injection, когда в запрос специально подмешивают вредные указания, и в сценариях со скрытыми целями. Во всех этих случаях он обгонял базовые подходы, а особенно заметный выигрыш дал там, где важна безопасность: когда надо понять, не утащила ли модель чужую инструкцию или скрытую цель. При этом авторы работали не с «живой» моделью как с чёрным ящиком, а с замороженной целевой моделью и отдельно обучаемым интерпретатором, который читает её внутренние состояния.

Ключевые цифры

280 kНа таком объёме примеров интерпретатор учили распознавать, какие инструкции скрываются внутри поведения модели — это уже не маленькая игрушечная проверка.
72%Столько данных в тренировочном корпусе пришлось на один из основных наборов примеров, так что обучение опиралось прежде всего на широкий диалоговый контекст.
28%Остальная часть тренировочных данных пришлась на примеры с более жёсткими ограничениями и требованиями к следованию инструкции.
50 записейИменно такой ручной аудит использовали, чтобы проверить, насколько разметка в данных действительно похожа на человеческую оценку.

Можно ли доверять

Это arXiv-препринт, а не статья после рецензирования, так что выводы пока ранние. С другой стороны, работу проверяли не на десятке примеров, а на больших корпусах и сразу в нескольких сложных сценариях, включая prompt injection и скрытые цели. Это делает результат интересным, но для окончательных выводов всё равно хочется увидеть независимую проверку и тесты в реальных агентных системах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас9 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыGilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky