dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Iterative Unalignment более чем в 800 раз эффективнее оценивает крайне редкие события

0

Кратко

Метод Iterative Unalignment меняет веса языковой модели, чтобы чаще находить заданные редкие события и точнее оценивать их исходную вероятность. В проверках на 319 искусственно заданных событиях и двух моделях он оказался более чем в 800 раз эффективнее обычного метода Монте-Карло для событий с вероятностью ниже 10⁻⁷.

Зачем это знать

Результат показывает, что редкие события в действиях языковых моделей можно оценивать гораздо эффективнее обычного метода Монте-Карло. Но метод пока проверяли только на контролируемых искусственных событиях, поэтому его польза для реальных катастрофических сбоев ещё не подтверждена.

Разбор

Проблема здесь не в том, чтобы один раз случайно дождаться сбоя, а в том, чтобы измерить его вероятность, когда нужная последовательность действий встречается почти никогда. Для обычного метода Монте-Карло это означает генерировать огромное число траекторий поведения модели и ждать редкие попадания. Авторы вместо этого временно меняют веса самой языковой модели и получают вспомогательную модель, которая чаще приводит к нужному событию.

Дальше они используют эту изменённую модель не как замену исходной, а как способ быстрее собрать полезные примеры. Специальная поправка учитывает, насколько новая модель отличается от исходной, поэтому найденные частые примеры можно пересчитать обратно в оценку исходной вероятности. Авторы обучают изменение весов градиентным методом — то есть постепенно подстраивают их по направлению, которое делает событие заметнее, но не позволяет оценке стать нестабильной.

Метод проверили в трёх группах искусственных событий: например, связанных с появлением заданных токенов и их комбинаций в последовательности. Оценки сравнивали с эталонными вероятностями, рассчитанными с относительной погрешностью менее 10%, а для каждой пары «метод — событие» выделяли одинаковый бюджет из 64 000 траекторий. Это позволило сравнить не только число найденных событий, но и вычислительные затраты на достижение заданной точности. Раньше подобный подход было трудно применять к языковым моделям: вероятность всей последовательности складывается из множества контекстно-зависимых шагов, и согласованно изменить их обычным способом непросто.

Ключевые цифры

319 событийМетод проверили на сотнях разных искусственных случаев, а не на одном специально подобранном примере.
64 000 траекторийДля оценки каждого события использовали одинаковое число сгенерированных вариантов поведения, поэтому методы можно сравнивать на равных.
<10% относительной стандартной ошибкиЭталонные вероятности рассчитали достаточно точно, чтобы заметить разницу между оценщиками, а не принять случайный шум за улучшение.
~120 млн и ~2,6 млрд параметровПроверка охватила две языковые модели заметно разного размера, хотя обе оставались исследовательскими, а не реальными автономными агентами.

Можно ли доверять

Это препринт arXiv, который ещё не прошёл независимую журнальную рецензию. Эксперименты выглядят тщательно контролируемыми: использовали 319 событий и точные эталонные оценки, но сами события искусственные, поэтому эффективность метода на настоящих опасных сбоях пока не подтверждена.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас22 сентября 2026 г.
Дата источника21 сентября 2026 г.
ОригиналОткрыть
АвторыHanming Yang, Daksh Mittal, Jing Dong, Hongseok Namkoong