Уверенность меняет решение ИИ отвечать или промолчать
Кратко
В эксперименте с языковыми моделями усиление или ослабление их внутренних сигналов уверенности меняло решение: отвечать на вопрос или воздержаться. Это показывает причинное влияние уверенности на поведение моделей, но не подтверждает, что такие оценки надёжны в реальных приложениях.
Зачем это знать
Отказ модели от ответа может зависеть не только от внешних правил, но и от её внутренней оценки уверенности. Это помогает точнее понимать поведение ИИ, хотя практическая надёжность такого сигнала пока не установлена.
Разбор
Авторы проверяли не просто связь между уверенностью модели и её ответом, а вмешивались в сам сигнал уверенности: в одних случаях усиливали его, в других — подавляли. Затем смотрели, меняется ли выбор языковой модели: дать ответ или отказаться. Такой подход важен потому, что позволяет проверить направление влияния — действительно ли уверенность участвует в принятии решения, а не просто появляется одновременно с ним.
До такого эксперимента можно было лишь наблюдать: модель чаще отвечает там, где выглядит уверенной, и чаще отказывается там, где уверенность ниже. Но по одному наблюдению нельзя понять, что именно на что влияет. Работа Kumaran и коллег показывает, что изменение этого внутреннего сигнала меняет поведение модели. При этом абстракт не сообщает, какие именно модели и задачи использовали, насколько часто они меняли решение и как вмешательство работало за пределами эксперимента.
Можно ли доверять
Статья опубликована в рецензируемом журнале Nature Machine Intelligence, поэтому её методику и выводы проверяли другие учёные. Но в абстракте нет данных о размере эксперимента, числе моделей и задачах, а также о проверке в реальных приложениях — по этим сведениям нельзя оценить, насколько широко результат переносится на практические системы.
Пересказано ИИ по научной статье. Как это устроено