dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Мягкие промпты лучше отделяют знание модели от формата ответа

0

Кратко

В препринте на 7 моделях и 7 бенчмарках авторы сравнили мягкую настройку промптов с обычными zero-shot и few-shot запросами. Подход помог точнее отделить знание модели от умения следовать формату и показал себя как более удобный способ сравнивать базовые модели между собой.

Зачем это знать

Это может сделать сравнение LLM более честным, особенно когда обычные бенчмарки путают знание с навыком оформления ответа. Но результат пока предварительный: это препринт, и он относится к оценке моделей, а не к совету для конечных пользователей.

Разбор

Авторы не стали менять саму модель или дообучать её «по-взрослому». Вместо этого они подстраивали только маленький набор мягких промптов — это не текстовый запрос, а несколько обучаемых векторов, которые помогают модели отвечать в нужном формате. Идея была в том, чтобы отделить два разных навыка: знает ли модель правильный ответ и умеет ли она оформить его так, как требует бенчмарк.

Это важно, потому что обычные проверки часто смешивают эти вещи. Базовая модель может знать ответ, но проигрывает просто потому, что не умеет подогнать его под строгий шаблон. Тогда сравнение моделей получается нечестным: выигрывает не более умная модель, а та, что лучше натренирована на формат. Мягкая настройка промптов должна была убрать именно этот перекос и показать, кто что действительно знает.

Что вышло на практике: мягкие промпты быстро доводили следование формату до потолка и делали это заметно эффективнее, чем zero-shot и few-shot запросы. Ещё один важный результат — на их основе ранжирование базовых моделей лучше совпадало с тем, как потом выглядят посттренированные модели. То есть такой подход может служить дешёвым «прокси» для понимания, какие предобученные модели в будущем окажутся сильнее после дополнительной настройки.

Ещё любопытно, что пользу от мягких промптов получили не только базовые, но и уже дообученные модели: им тоже удавалось точнее соблюдать формат. Так что это не просто трюк для одной узкой задачи, а более общий способ честнее сравнивать модели между собой, не устраивая полноценный и дорогой посттренинг для каждой из них.

Ключевые цифры

7 моделейПодход проверили не на одной-двух архитектурах, а сразу на нескольких, так что результат меньше похож на случайность.
7 бенчмарковСравнение прогнали на разных типах задач, а не на одной удобной проверке.
10 soft-prompt vectorsДля подстройки хватило всего 10 обучаемых векторов — это очень маленькая надстройка поверх модели.
0.0006% параметровНастраивали ничтожную долю всей модели, поэтому способ требует мало памяти и вычислений.
80 steps (~640 samples)Формат ответа доводили до стабильного уровня всего за короткую подстройку на сотнях примеров, а не на миллионах.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверили независимые рецензенты. С другой стороны, авторы тестировали подход не на одной модели, а на семи моделях и семи наборах задач, так что выводы выглядят крепче, чем на совсем узком эксперименте. Но это всё же исследование про оценку моделей, а не про готовый продукт для пользователей.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыSelen Erkan, Bastian Boll, Kristian Kersting, Björn Deiseroth, Letitia Parcalabescu