Препринт — материал ещё не прошёл рецензирование
PRISM извлекает инструкции из скрытых состояний языковой модели
Кратко
PRISM — это интерпретатор, который по активациям модели пытается восстановить набор действующих инструкций. В препринте на arXiv он лучше базовых подходов переводил скрытые состояния в список инструкций в обычных, ограниченных, уязвимых к инъекциям и скрытых сценариях.
Зачем это знать
Это может помочь лучше понимать, какие указания реально ведут поведение агентных LLM. Но пока это лишь препринт и сравнение с бенчмарками, так что выводы стоит воспринимать как ранние.
Разбор
Авторы не просто пытались угадать «о чём думает» языковая модель, а поставили более узкую задачу: восстановить список активных инструкций, которые прямо сейчас направляют ответ модели. Для этого они берут короткий кусок скрытых состояний модели — внутренние числовые сигналы, которые обычно не видны пользователю, — и учат отдельный интерпретатор превращать их в понятный человеку список пунктов: что нужно сделать, чего избегать и какие подзадачи держать в голове.
Главная новизна в том, что PRISM обучали не просто на совпадение текста, а на качество самого списка. Сначала его настраивали на размеченных примерах, а потом дообучали с помощью другой модели-судьи, которая проверяла две вещи: покрыты ли все важные инструкции и не добавил ли интерпретатор лишнего. Это важно, потому что старые методы «от активаций к тексту» обычно хорошо пересказывают общий смысл, но не умеют аккуратно восстанавливать полный набор одновременно действующих указаний — а в агентных сценариях именно это и нужно.
Проверяли PRISM в нескольких режимах: на обычных запросах, на задачах с жёсткими ограничениями, в ситуациях с prompt injection, когда в запрос специально подмешивают вредные указания, и в сценариях со скрытыми целями. Во всех этих случаях он обгонял базовые подходы, а особенно заметный выигрыш дал там, где важна безопасность: когда надо понять, не утащила ли модель чужую инструкцию или скрытую цель. При этом авторы работали не с «живой» моделью как с чёрным ящиком, а с замороженной целевой моделью и отдельно обучаемым интерпретатором, который читает её внутренние состояния.
Ключевые цифры
Можно ли доверять
Это arXiv-препринт, а не статья после рецензирования, так что выводы пока ранние. С другой стороны, работу проверяли не на десятке примеров, а на больших корпусах и сразу в нескольких сложных сценариях, включая prompt injection и скрытые цели. Это делает результат интересным, но для окончательных выводов всё равно хочется увидеть независимую проверку и тесты в реальных агентных системах.
Пересказано ИИ по научной статье. Как это устроено