Препринт — материал ещё не прошёл рецензирование
Структурный формат мешает не всем моделям
Кратко
В препринте на четырёх моделях и пяти бенчмарках проверили, как JSON и другие структурированные форматы влияют на рассуждение. Авторы показывают, что потери качества зависят не столько от самого формата, сколько от запаса мощности модели: при большем «запасе» падения почти нет, а при его нехватке точность заметно снижается, особенно при более сложных схемах и если форматирование требует закончить ответ раньше рассуждения.
Зачем это знать
Это помогает точнее понимать, когда структурированный вывод становится помехой для модели, а не универсальной проблемой. Но из-за статуса препринта и ограниченной базы результатов это пока не повод делать жёсткие выводы о практике без дополнительных проверок.
Разбор
Авторы не просто сравнили «обычный» ответ и JSON, а попытались отделить влияние самого формата от влияния длины запроса. Для этого они брали информационно сопоставимые тексты и постепенно усложняли схему: чем больше полей и жёстче правила вывода, тем сильнее модель должна одновременно думать и следить за структурой ответа.
Главная идея получилась не такой, как в привычной версии про «структурный формат всегда мешает рассуждению». Оказалось, что всё упирается в запас мощности модели. Если у модели есть свободный ресурс, JSON почти не бьёт по качеству: на одной из моделей разница между JSON и обычным рассуждением на MATH-Hard вышла совсем маленькой. А вот если модель работает почти на пределе, формат может заметно просадить точность — причём по разным причинам. У одних систем ответ обрывается раньше, чем они успевают додумать решение, у других проблема остаётся даже при снятом лимите по длине: сама необходимость одновременно рассуждать и сразу укладываться в структуру съедает качество.
Ещё один важный результат — вред от формата растёт вместе со сложностью схемы. То есть короткий и простой JSON страдает меньше, чем громоздкий. И это не сводится просто к тому, что промпт стал длиннее: авторы специально это проверяли и показали, что длина текста сама по себе не объясняет падение. Когда же модели разрешали сначала свободно подумать, а уже потом упаковывать ответ в формат, большая часть потерь возвращалась обратно. Это хороший намёк на то, что проблема не в машинно-читаемом формате как таковом, а в том, на каком этапе его заставляют появляться.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. С другой стороны, авторы прогнали её на 4 моделях и 5 бенчмарках и отдельно разложили причины падения качества, так что картина выглядит неплохой для ранней стадии. Но пока это всё равно стоит воспринимать как сильный сигнал, а не как окончательный вердикт для всех моделей и задач.
Пересказано ИИ по научной статье. Как это устроено