dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Обучение с подкреплением сделало советы ИИ к рассказам конкретнее

0

Кратко

На трёх наборах рассказов ИИ предлагал более конкретные и привязанные к тексту замечания, чем сравниваемые модели, включая Gemini. Самыми важными оказались не общие оценки, а практические предложения: что именно изменить и какую проблему исправить первой.

Зачем это знать

Такой подход может сделать помощь ИИ авторам более содержательной и менее шаблонной. Но пока оценивали качество самих замечаний, а не то, стали ли после них рассказы или навыки авторов лучше.

Разбор

Авторы не учили модель копировать эталонные рецензии: для таких отзывов обычно трудно заранее составить единственно правильный ответ. Вместо этого они дали модели несколько целей — найти главную проблему в рассказе, привязать замечание к конкретному тексту и предложить полезное действие. Затем модель дообучали методом обучения с подкреплением: за отзыв она получала условную «награду» по каждой из этих сторон, а не за совпадение с готовым образцом.

Проверку провели на трёх корпусах рассказов и сравнили результат с базовыми версиями моделей и Gemini 2.5 Flash. Отдельно использовали два режима: в одном модели заранее указывали, на какие проблемы смотреть, в другом просили оценить рассказ более свободно. Свободный режим часто давал лучший общий результат: слишком много ограничений, судя по оценкам, могло заставлять модель писать по одному шаблону.

Особенно заметный эффект появился у моделей Qwen: их базовые версии нередко плохо определяли, какую проблему нужно исправить первой, а после обучения с подкреплением они получили самые высокие оценки по этому критерию на всех трёх наборах. Важно и то, что относительно небольшие модели с открытыми весами — от 7 до 9 миллиардов параметров — стабильно обошли Gemini 2.5 Flash именно в задаче разбора рассказов. Это не доказывает, что они лучше вообще во всём: преимущество показали в специально выбранной задаче и по качеству отзывов.

Ключевые цифры

3 корпуса рассказовМетод проверили не на одном наборе примеров, а на трёх разных подборках текстов.
7–9 млрд параметровМодели сравнительно небольшого размера смогли превзойти более общий коммерческий сервис в этой узкой задаче.
0,46Независимые оценщики совпадали между собой лишь умеренно, поэтому тонкие различия между системами стоит трактовать осторожно.
2,96 против 6,11На наборе WritingPrompts модель Gemma после обучения заняла гораздо более высокое место в рейтинге отзывов, чем Gemini 2.5 Flash; в этом рейтинге меньшее число означает лучший результат.

Можно ли доверять

Это препринт с arXiv, а не статья, прошедшая полноценную проверку рецензентами. Сильная сторона — сравнение на трёх наборах и дополнительная оценка людьми, но согласие оценщиков было только умеренным (0,46), а влияние отзывов на реальные рассказы или навыки авторов не проверяли.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас8 сентября 2026 г.
Дата источника4 сентября 2026 г.
ОригиналОткрыть
АвторыMaja Stahl, Timon Ziegenbein, Henning Wachsmuth