dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Восьми открытым языковым моделям не удалось распознать вмешательство в свои вычисления

0

Кратко

Авторы проверили восемь открытых языковых моделей более чем в 78 тысячах измерений: модели просили определить, меняли ли их вычисления, и отвечали примерно случайным образом. При этом нужная информация сохранялась во внутренних сигналах моделей и могла быть извлечена специальным анализом, но не превращалась в обычный словесный ответ.

Зачем это знать

Результат предупреждает: собственные объяснения ИИ пока нельзя считать надёжной проверкой того, что происходит внутри модели. Вывод относится к конкретным вмешательствам и тестам, поэтому не описывает все возможные формы самопроверки будущих систем.

Разбор

Авторы не просто спросили модели о своих вычислениях, а устроили контролируемый эксперимент. Они меняли отдельные участки работы модели — внутренний поток данных, работу конкретных механизмов внимания и признаки, найденные разреженным автоэнкодером — а затем сравнивали ответ с тремя контрольными вариантами: запуском без изменений, случайным вмешательством той же силы и наблюдателем, который видел только готовый текст. Такой дизайн помогает отделить настоящую самопроверку от догадки или реакции на случайный шум.

Проверку провели на задачах из 12 наборов: от арифметики и программирования до здравого смысла и правдивости. Главный результат оказался не в словах моделей, а в разрыве между их внутренними сигналами и ответами. Специальный классификатор, обученный читать эти сигналы, находил факт вмешательства с точностью от 75% до 95,8%, причём ближе к моменту выдачи ответа сигнал становился ещё яснее. Значит, информация о сбое не исчезала внутри модели — она не доходила до обычного «да» или «нет».

Авторы отдельно проверили, не связано ли это с тем, что задача сама по себе слишком трудная: модель, которую специально дообучили сообщать о таких вмешательствах, почти идеально справилась на новых примерах. В одном случае исходная модель не меняла сам ответ, но её уверенность различалась между настоящим вмешательством и контрольным запуском. Это указывает на конкретное слабое место: проблема возникает не при сохранении информации, а при переводе внутреннего состояния в словесный отчёт.

Ключевые цифры

12 наборов задачМодели проверяли не на одном типе вопросов, а на широком спектре — от математики и кода до правдивости.
75–95,8%Внутренние сигналы позволяли отдельному анализу находить вмешательство заметно лучше случайного угадывания.
AUROC 0,647В одном случае полезный сигнал проявлялся в уверенности модели, хотя её неизменный ответ сам по себе ничего не показывал.
менее 0,15 процентного пункта AUROCСтатистический анализ ограничил возможный выигрыш обычного словесного отчёта настолько жёстко, что практически исключил заметную способность к распознаванию.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая рецензирование. Эксперимент выглядит основательно: авторы сравнили восемь моделей из семи семейств, использовали несколько контрольных условий и более 78 тысяч измерений. Но вывод относится к открытым моделям и конкретному классу вмешательств; по нему нельзя уверенно судить о будущих или закрытых системах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас24 августа 2026 г.
Дата источника20 августа 2026 г.
ОригиналОткрыть
АвторыEmilio Ferrara