dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Названия действий меняют поиск ИИ: помогают при верной подсказке и мешают при ошибочной

0

Кратко

В простой задаче с тремя вариантами текстовые названия действий заметно меняли поведение языковых моделей. Если название намекало на правильный выбор, модель реже проверяла другие варианты; при ошибочном намёке это резко ухудшало результат. Отрицательные оценки заставляли её исследовать больше, чем такие же по величине положительные оценки.

Зачем это знать

Это ранний сигнал риска для ИИ, который сам принимает решения: слова в описании задачи могут незаметно направлять его поиск. Результат получен в искусственной задаче, поэтому пока неясно, насколько сильно такой эффект проявляется в реальных системах.

Разбор

Авторы придумали вариант классической задачи «многорукого бандита»: у агента есть несколько действий, и он должен понять, какое из них приносит больше награды. Новшество в том, что действия обозначают не безликими номерами, а словами. Так можно отделить собственно обучение по результатам от влияния смысла, который модель заранее связывает с этими словами.

Исследователи сравнили несколько типов названий: нейтральные буквенно-цифровые метки, порядковые обозначения, слова из обычного мира и названия с эмоциональной окраской. Затем они посмотрели, сколько раз модель пробует разные варианты, прежде чем остановиться на одном. Для ориентира использовали поведение классического алгоритма UCB1 — математического правила, которое специально удерживает баланс между проверкой новых вариантов и выбором уже известного лучшего.

Самый показательный результат появился в задаче без случайного шума: после проверки действия его награда не менялась. Даже здесь смена одних только названий могла перевести модель от почти оптимального поведения к почти худшему. Нейтральные метки чаще давали поведение, похожее на обычный алгоритм поиска, а смысловые метки подталкивали модель сразу использовать «понятный» вариант. Это помогает, когда смысл названия совпадает с настоящей наградой, и становится ловушкой, когда совпадения нет.

Отдельно авторы заметили, что одинаковые по величине отрицательные и положительные награды действуют на модель по-разному: отрицательные сильнее заставляют её возвращаться к проверке других действий. Авторы связывают это с тем, как в обучающих текстах обычно описывают хорошие и плохие исходы, но подчёркивают практический риск: тесты с естественными, удачно подобранными названиями могут завышать оценку системы, потому что она угадывает по смысловым подсказкам, а не действительно исследует среду.

Можно ли доверять

Это препринт на arXiv, поэтому работу ещё не проверили независимые рецензенты. Кроме того, выводы получены на искусственной задаче с тремя действиями и без шума, а не на реальных решениях или взаимодействии с людьми; перенос эффекта на сложные системы пока не показан.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас18 августа 2026 г.
Дата источника17 августа 2026 г.
ОригиналОткрыть
АвторыDavid Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung