dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Структурный формат мешает не всем моделям

0

Кратко

В препринте на четырёх моделях и пяти бенчмарках проверили, как JSON и другие структурированные форматы влияют на рассуждение. Авторы показывают, что потери качества зависят не столько от самого формата, сколько от запаса мощности модели: при большем «запасе» падения почти нет, а при его нехватке точность заметно снижается, особенно при более сложных схемах и если форматирование требует закончить ответ раньше рассуждения.

Зачем это знать

Это помогает точнее понимать, когда структурированный вывод становится помехой для модели, а не универсальной проблемой. Но из-за статуса препринта и ограниченной базы результатов это пока не повод делать жёсткие выводы о практике без дополнительных проверок.

Разбор

Авторы не просто сравнили «обычный» ответ и JSON, а попытались отделить влияние самого формата от влияния длины запроса. Для этого они брали информационно сопоставимые тексты и постепенно усложняли схему: чем больше полей и жёстче правила вывода, тем сильнее модель должна одновременно думать и следить за структурой ответа.

Главная идея получилась не такой, как в привычной версии про «структурный формат всегда мешает рассуждению». Оказалось, что всё упирается в запас мощности модели. Если у модели есть свободный ресурс, JSON почти не бьёт по качеству: на одной из моделей разница между JSON и обычным рассуждением на MATH-Hard вышла совсем маленькой. А вот если модель работает почти на пределе, формат может заметно просадить точность — причём по разным причинам. У одних систем ответ обрывается раньше, чем они успевают додумать решение, у других проблема остаётся даже при снятом лимите по длине: сама необходимость одновременно рассуждать и сразу укладываться в структуру съедает качество.

Ещё один важный результат — вред от формата растёт вместе со сложностью схемы. То есть короткий и простой JSON страдает меньше, чем громоздкий. И это не сводится просто к тому, что промпт стал длиннее: авторы специально это проверяли и показали, что длина текста сама по себе не объясняет падение. Когда же модели разрешали сначала свободно подумать, а уже потом упаковывать ответ в формат, большая часть потерь возвращалась обратно. Это хороший намёк на то, что проблема не в машинно-читаемом формате как таковом, а в том, на каком этапе его заставляют появляться.

Ключевые цифры

4 моделиПроверку сделали не на одной системе, а сразу на нескольких, так что эффект формата не привязан к одной конкретной модели.
5 бенчмарковВыводы сравнили на нескольких типах задач, а не на одном тесте, поэтому картина выглядит надёжнее.
36.2 п.п.На одной из моделей точность упала очень резко — почти на две пятых результатов — когда ей пришлось отвечать в жёстком формате.
28.0 п.п.Даже когда убрали проблему с обрывом ответа, другая модель всё равно сильно потеряла в точности из-за самого требования формата.
96.2%На одной из самых сильных моделей качество решения было очень высоким даже до добавления JSON — то есть запас мощности у неё уже был большой.
91.0%После перехода в JSON качество у той же модели немного снизилось, но она всё равно осталась на высоком уровне.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. С другой стороны, авторы прогнали её на 4 моделях и 5 бенчмарках и отдельно разложили причины падения качества, так что картина выглядит неплохой для ранней стадии. Но пока это всё равно стоит воспринимать как сильный сигнал, а не как окончательный вердикт для всех моделей и задач.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас9 июня 2026 г.
Дата источника8 июня 2026 г.
ОригиналОткрыть
АвторыHengxin Fan