Препринт — материал ещё не прошёл рецензирование
Обучение с подкреплением сделало советы ИИ к рассказам конкретнее
Кратко
На трёх наборах рассказов ИИ предлагал более конкретные и привязанные к тексту замечания, чем сравниваемые модели, включая Gemini. Самыми важными оказались не общие оценки, а практические предложения: что именно изменить и какую проблему исправить первой.
Зачем это знать
Такой подход может сделать помощь ИИ авторам более содержательной и менее шаблонной. Но пока оценивали качество самих замечаний, а не то, стали ли после них рассказы или навыки авторов лучше.
Разбор
Авторы не учили модель копировать эталонные рецензии: для таких отзывов обычно трудно заранее составить единственно правильный ответ. Вместо этого они дали модели несколько целей — найти главную проблему в рассказе, привязать замечание к конкретному тексту и предложить полезное действие. Затем модель дообучали методом обучения с подкреплением: за отзыв она получала условную «награду» по каждой из этих сторон, а не за совпадение с готовым образцом.
Проверку провели на трёх корпусах рассказов и сравнили результат с базовыми версиями моделей и Gemini 2.5 Flash. Отдельно использовали два режима: в одном модели заранее указывали, на какие проблемы смотреть, в другом просили оценить рассказ более свободно. Свободный режим часто давал лучший общий результат: слишком много ограничений, судя по оценкам, могло заставлять модель писать по одному шаблону.
Особенно заметный эффект появился у моделей Qwen: их базовые версии нередко плохо определяли, какую проблему нужно исправить первой, а после обучения с подкреплением они получили самые высокие оценки по этому критерию на всех трёх наборах. Важно и то, что относительно небольшие модели с открытыми весами — от 7 до 9 миллиардов параметров — стабильно обошли Gemini 2.5 Flash именно в задаче разбора рассказов. Это не доказывает, что они лучше вообще во всём: преимущество показали в специально выбранной задаче и по качеству отзывов.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая полноценную проверку рецензентами. Сильная сторона — сравнение на трёх наборах и дополнительная оценка людьми, но согласие оценщиков было только умеренным (0,46), а влияние отзывов на реальные рассказы или навыки авторов не проверяли.
Пересказано ИИ по научной статье. Как это устроено