dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Тон запроса меняет длину ответа и расход токенов у ИИ-моделей

1

Кратко

Авторы проверили это на 570 вопросах из набора MMLU и семи вариантах тона — от заискивающего до угрожающего. Разброс в числе выходных токенов оказался заметно больше, чем разброс точности ответов, а расход токенов менялся до 44,3%.

Зачем это знать

Это показывает, что стиль обращения к модели может влиять не только на результат, но и на стоимость её работы. Пока это ранняя проверка на ограниченном наборе задач и моделей, поэтому вывод стоит воспринимать как повод следить за тоном запросов, а не как универсальное правило.

Разбор

Авторы не просто смотрели, «правильно» ли модель отвечает, а отдельно мерили, сколько текста она выдает в ответе. Для этого они взяли 570 вопросов из MMLU — популярного набора задач, где модели проверяют на знаниях из разных областей, — и прогнали их через семь вариантов формулировки запроса: от льстивого до угрожающего. Так они пытались понять, меняет ли манера обращения не только качество ответа, но и то, сколько вычислений модель тратит на каждом шаге.

Самое интересное оказалось в том, что длина ответов гуляла сильнее, чем точность. То есть одна и та же модель могла отвечать примерно так же верно, но заметно по-разному по объему: где-то писать короче, где-то развернутее. Это важно, потому что в сервисах с оплатой за токены лишние слова — это уже не просто стиль, а прямые деньги.

Еще один любопытный результат: у ChatGPT 4o и 5-nano грубый тон оказался самым выигрышным по соотношению точности и длины ответа. У Gemini 2.5 Flash и 2.5 Flash Lite в «победители» попали грубый и нейтральный тон. Иными словами, не один и тот же стиль лучше для всех моделей: у каждой, похоже, свой чувствительный настрой, а значит, и свой баланс между качеством и стоимостью.

Ключевые цифры

570 вопросовПроверка шла на довольно небольшом наборе задач, поэтому это скорее точный эксперимент, чем окончательный вердикт для всех случаев.
7 тоновИсследователи сравнили сразу несколько манер общения — от лестной до агрессивной, чтобы увидеть, как модель реагирует на стиль.
44,3%Столько максимум менялся расход токенов — то есть за ту же задачу модель могла «наговорить» почти на половину больше или меньше.

Можно ли доверять

Это препринт на arXiv, значит, работу еще не прошли внешнее рецензирование. Проверяли на одном наборе вопросов и нескольких моделях, так что выводы хорошо показывают эффект, но пока не гарантируют, что он будет таким же в других задачах и системах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас28 июля 2026 г.
Дата источника27 июля 2026 г.
ОригиналОткрыть
АвторыAkhil Kumar, Om Dobariya