dumai
🤖
ИИNature Machine Intelligence

Уверенность меняет решение ИИ отвечать или промолчать

0

Кратко

В эксперименте с языковыми моделями усиление или ослабление их внутренних сигналов уверенности меняло решение: отвечать на вопрос или воздержаться. Это показывает причинное влияние уверенности на поведение моделей, но не подтверждает, что такие оценки надёжны в реальных приложениях.

Зачем это знать

Отказ модели от ответа может зависеть не только от внешних правил, но и от её внутренней оценки уверенности. Это помогает точнее понимать поведение ИИ, хотя практическая надёжность такого сигнала пока не установлена.

Разбор

Авторы проверяли не просто связь между уверенностью модели и её ответом, а вмешивались в сам сигнал уверенности: в одних случаях усиливали его, в других — подавляли. Затем смотрели, меняется ли выбор языковой модели: дать ответ или отказаться. Такой подход важен потому, что позволяет проверить направление влияния — действительно ли уверенность участвует в принятии решения, а не просто появляется одновременно с ним.

До такого эксперимента можно было лишь наблюдать: модель чаще отвечает там, где выглядит уверенной, и чаще отказывается там, где уверенность ниже. Но по одному наблюдению нельзя понять, что именно на что влияет. Работа Kumaran и коллег показывает, что изменение этого внутреннего сигнала меняет поведение модели. При этом абстракт не сообщает, какие именно модели и задачи использовали, насколько часто они меняли решение и как вмешательство работало за пределами эксперимента.

Можно ли доверять

Статья опубликована в рецензируемом журнале Nature Machine Intelligence, поэтому её методику и выводы проверяли другие учёные. Но в абстракте нет данных о размере эксперимента, числе моделей и задачах, а также о проверке в реальных приложениях — по этим сведениям нельзя оценить, насколько широко результат переносится на практические системы.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналNature Machine Intelligence
Дата публикации у нас8 сентября 2026 г.
Дата источника7 сентября 2026 г.
ОригиналОткрыть
АвторыDharshan Kumaran, Nathaniel Daw, Simon Osindero, Petar Veličković, Viorica Patraucean