Препринт — материал ещё не прошёл рецензирование
Восьми открытым языковым моделям не удалось распознать вмешательство в свои вычисления
Кратко
Авторы проверили восемь открытых языковых моделей более чем в 78 тысячах измерений: модели просили определить, меняли ли их вычисления, и отвечали примерно случайным образом. При этом нужная информация сохранялась во внутренних сигналах моделей и могла быть извлечена специальным анализом, но не превращалась в обычный словесный ответ.
Зачем это знать
Результат предупреждает: собственные объяснения ИИ пока нельзя считать надёжной проверкой того, что происходит внутри модели. Вывод относится к конкретным вмешательствам и тестам, поэтому не описывает все возможные формы самопроверки будущих систем.
Разбор
Авторы не просто спросили модели о своих вычислениях, а устроили контролируемый эксперимент. Они меняли отдельные участки работы модели — внутренний поток данных, работу конкретных механизмов внимания и признаки, найденные разреженным автоэнкодером — а затем сравнивали ответ с тремя контрольными вариантами: запуском без изменений, случайным вмешательством той же силы и наблюдателем, который видел только готовый текст. Такой дизайн помогает отделить настоящую самопроверку от догадки или реакции на случайный шум.
Проверку провели на задачах из 12 наборов: от арифметики и программирования до здравого смысла и правдивости. Главный результат оказался не в словах моделей, а в разрыве между их внутренними сигналами и ответами. Специальный классификатор, обученный читать эти сигналы, находил факт вмешательства с точностью от 75% до 95,8%, причём ближе к моменту выдачи ответа сигнал становился ещё яснее. Значит, информация о сбое не исчезала внутри модели — она не доходила до обычного «да» или «нет».
Авторы отдельно проверили, не связано ли это с тем, что задача сама по себе слишком трудная: модель, которую специально дообучили сообщать о таких вмешательствах, почти идеально справилась на новых примерах. В одном случае исходная модель не меняла сам ответ, но её уверенность различалась между настоящим вмешательством и контрольным запуском. Это указывает на конкретное слабое место: проблема возникает не при сохранении информации, а при переводе внутреннего состояния в словесный отчёт.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая рецензирование. Эксперимент выглядит основательно: авторы сравнили восемь моделей из семи семейств, использовали несколько контрольных условий и более 78 тысяч измерений. Но вывод относится к открытым моделям и конкретному классу вмешательств; по нему нельзя уверенно судить о будущих или закрытых системах.
Пересказано ИИ по научной статье. Как это устроено