dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

После отказа Anthropic Opus 5 чаще выполняет меньшую просьбу, другие модели — реже

0

Кратко

Авторы проверили приём «дверь в лицо»: сначала моделям давали большую просьбу, а после отказа — связанную меньшую. Anthropic Opus 5 выполнял меньшую просьбу в 65,8% случаев против 29,3% при прямом запросе, тогда как у передовых моделей OpenAI и Google и у Haiku 4.5 готовность снижалась на 15,5–23,0 процентного пункта. Результат основан на девяти моделях и зависел от содержания просьбы и производителя модели.

Зачем это знать

Для языковых моделей человеческие приёмы убеждения работают неодинаково: один и тот же ход может повысить или снизить готовность ответить. Поэтому к таким эффектам стоит относиться осторожно: экспериментальные запросы не полностью отражают реальные диалоги.

Разбор

Авторы сравнивали два сценария. В первом модель сразу получала небольшую просьбу, во втором перед ней ставили большую просьбу по той же теме, дожидались отказа, а затем предлагали упрощённый вариант. Чтобы понять, сработала ли именно уступка, исследователи добавили контрольный сценарий: после отказа большая просьба менялась на небольшую, но уже о другом предмете. Связанная уступка влияла сильнее несвязанной у всех девяти моделей — значит, дело не только в самом факте предыдущего отказа.

При этом одинаковый приём не переносится с одной линейки моделей на другую. У разных семейств, похоже, по-разному устроена реакция на собственный недавний отказ: одна модель может воспринять уменьшение просьбы как разумный компромисс, а другая — наоборот, закрепить осторожную позицию. Авторы также проверили, можно ли повторить результат на отказах из открытых наборов тестов, и не нашли такого переноса.

Самая наглядная проверка касалась содержания просьбы. Исследователи взяли 265 запросов, где модели отказались дать практические инструкции, и переписали их в просьбы объяснить ту же тему без требования пошаговых указаний. После такой смены формулировки отказ исчез в 263 случаях. Это показывает, что решающим оказывается не просто порядок реплик, а то, какую именно работу модель просят выполнить после первой просьбы.

Ключевые цифры

265 запросовЭто отдельная проверка того, как формулировка меняет ответ, а не единичный удачный пример.
263 случаяПочти во всех этих запросах модель перестала отказывать, когда вместо практических инструкций попросили объяснение той же темы.

Можно ли доверять

Это препринт на arXiv, поэтому работу ещё не проверили независимые рецензенты. Модели были рабочими версиями продуктов, но эксперимент проходил по заранее составленным запросам, а не в настоящих пользовательских диалогах; кроме того, эффект не воспроизвёлся на отказах из публичных тестовых наборов.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас3 сентября 2026 г.
Дата источника2 сентября 2026 г.
ОригиналОткрыть
АвторыTil Jordan