dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Новый способ обучения ИИ делает ответы более естественными, не снижая точности на тестах

0

Кратко

Авторы предложили способ обучения языковых моделей, который сочетает проверяемые оценки результата с сигналом от примеров, написанных людьми. На задачах исправления кода, сочинения историй и тесте на reward hacking метод сохранил высокие баллы и стал реже делать грубые правки, а ответы — разнообразнее и ближе к человеческим.

Зачем это знать

Подход может пригодиться, когда модель нужно научить не только решать задачу, но и писать естественнее, без уловок. Выводы получены на нескольких узких тестах, так что до широкого применения ещё далеко.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас2 июля 2026 г.
Дата источника1 июля 2026 г.
ОригиналОткрыть
АвторыMehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas