Препринт — материал ещё не прошёл рецензирование
Тон запроса меняет длину ответа и расход токенов у ИИ-моделей
Кратко
Авторы проверили это на 570 вопросах из набора MMLU и семи вариантах тона — от заискивающего до угрожающего. Разброс в числе выходных токенов оказался заметно больше, чем разброс точности ответов, а расход токенов менялся до 44,3%.
Зачем это знать
Это показывает, что стиль обращения к модели может влиять не только на результат, но и на стоимость её работы. Пока это ранняя проверка на ограниченном наборе задач и моделей, поэтому вывод стоит воспринимать как повод следить за тоном запросов, а не как универсальное правило.
Разбор
Авторы не просто смотрели, «правильно» ли модель отвечает, а отдельно мерили, сколько текста она выдает в ответе. Для этого они взяли 570 вопросов из MMLU — популярного набора задач, где модели проверяют на знаниях из разных областей, — и прогнали их через семь вариантов формулировки запроса: от льстивого до угрожающего. Так они пытались понять, меняет ли манера обращения не только качество ответа, но и то, сколько вычислений модель тратит на каждом шаге.
Самое интересное оказалось в том, что длина ответов гуляла сильнее, чем точность. То есть одна и та же модель могла отвечать примерно так же верно, но заметно по-разному по объему: где-то писать короче, где-то развернутее. Это важно, потому что в сервисах с оплатой за токены лишние слова — это уже не просто стиль, а прямые деньги.
Еще один любопытный результат: у ChatGPT 4o и 5-nano грубый тон оказался самым выигрышным по соотношению точности и длины ответа. У Gemini 2.5 Flash и 2.5 Flash Lite в «победители» попали грубый и нейтральный тон. Иными словами, не один и тот же стиль лучше для всех моделей: у каждой, похоже, свой чувствительный настрой, а значит, и свой баланс между качеством и стоимостью.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу еще не прошли внешнее рецензирование. Проверяли на одном наборе вопросов и нескольких моделях, так что выводы хорошо показывают эффект, но пока не гарантируют, что он будет таким же в других задачах и системах.
Пересказано ИИ по научной статье. Как это устроено