dumai
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Обучение с подкреплением помогает редактировать нейросети точнее

0

Кратко

Авторы представили рамку, где редактирование нейросети рассматривают как задачу обучения с подкреплением. В двух контролируемых средах агенты учились вносить целевые изменения в веса модели, сохраняя общую полезность.

Зачем это знать

Это показывает, что для некоторых задач редактирования моделей можно учить политику по награде вместо того, чтобы вручную проектировать отдельный алгоритм под каждый случай. Но результаты пока получены в препринте и на ограниченном наборе задач, поэтому их скорее стоит считать направлением для дальнейшей проверки.

Разбор

Авторы не стали придумывать новый алгоритм редактирования модели под каждую задачу. Вместо этого они собрали две учебные среды для агента, который видит веса нейросети и может их менять: в одной среде он умножает веса на константу, в другой — прибавляет к ним константу. После каждого шага агент получает новую версию весов и награду, которая показывает, насколько хорошо он одновременно двигается к нужной правке и не ломает общую работу модели.

Зачем это вообще понадобилось? Потому что обычное редактирование нейросетей часто требует отдельного специального метода под каждую цель — например, чтобы убрать нежелательную информацию или снизить смещение в ответах. Это долго и неудобно, особенно если хочется один и тот же подход применять к разным задачам. Здесь авторы проверили идею: можно ли научить политику редактирования напрямую по награде, как в обычном обучении с подкреплением, вместо ручной сборки алгоритма под каждую проблему.

Проверяли это на двух знакомых сценариях: удаление информации из модели и снижение bias, то есть систематического перекоса в классификации текста. В задаче удаления знаний агент почти полностью «забыл» целевой класс и при этом сохранил качество на остальных данных: точность на наборе для удаления упала почти до нуля, а на сохраняемом наборе осталась выше 90%. В задаче со смещением политики тоже сработали: качество по показателю, связанному с bias, улучшилось более чем на 5%, и при этом общая полезность модели не просела. Интересная деталь — агент учился только на 15% обучающих данных MNIST, но потом его поведение неплохо перенеслось на тестовые данные, которые он раньше не видел.

Ключевые цифры

15%Политику редактирования обучали не на всём датасете, а лишь на небольшой его части, и она всё равно смогла обобщиться.
92.84%Столько правильных ответов давала исходная модель на данных, которые нужно было сохранить — хороший ориентир для сравнения.
93.51%После правки модель даже чуть лучше справилась с сохраняемыми данными, то есть полезные знания не пострадали.
0%Точность на данных, которые нужно было «забыть», упала почти до нуля — значит, целевую информацию действительно удалось вычистить.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверили независимые рецензенты. Проверка была на двух контролируемых средах и на ограниченном наборе задач, а не в широком реальном применении, так что выводы выглядят многообещающе, но пока их стоит считать ранней демонстрацией идеи.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас12 июня 2026 г.
Дата источника11 июня 2026 г.
ОригиналОткрыть
АвторыShaivi Malik