dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Метод с несколькими источниками реже пропускает скрытый вред от дообучения

0

Кратко

Авторы предлагают брать несколько отдельных моделей, дообученных на данных из разных источников, и объединять их ответы при выборе следующего слова. В проверках на контролируемой «отравке» данных, скрытом обучении и смещении поведения такой подход чаще блокировал изменения, которые появлялись только из части источников, и лучше сохранял общие полезные реакции.

Зачем это знать

Это показывает способ строить более устойчивые языковые модели, если данные могут приходить из разных и не вполне надёжных источников. Пока это ранний результат на контролируемых тестах, поэтому его стоит рассматривать как направление для дальнейшей проверки, а не как готовый рецепт для практики.

Разбор

Авторы не пытаются «починить» плохие данные напрямую. Вместо этого они делают ход с запасом: обучают не одну модель, а несколько отдельных, и каждую — на своём источнике данных. Потом при выборе следующего слова смотрят не на один ответ, а на то, что совпадает у этих моделей. Идея простая: если полезное поведение повторяется в разных источниках, оно должно выжить; если вред пришёл только из одного или нескольких подозрительных наборов, его легче отрезать.

Чтобы это работало, они придумали два варианта «голосования» между моделями. В первом варианте каждое возможное слово ограничивают самой низкой оценкой, которую ему дала любая из моделей — так агрессивные варианты хуже проходят. Во втором варианте они сравнивают ответы с базовой моделью и возвращают базовую вероятность там, где источники тянут в разные стороны. Ещё они ослабили требование к совпадению: иногда модели могут поддерживать не одно и то же слово, а разные слова с тем же смыслом, и метод это тоже пытается учитывать.

Проверяли подход не на абстрактных идеях, а на трёх типах проблем: когда данные специально «отравляют» вредным поведением, когда в обучении прячут нежелательные предпочтения, и когда модель начинает вести себя не так, как надо, без явной команды. На этих тестах согласованное декодирование чаще гасило именно поведение, пришедшее из части источников, но при этом сохраняло полезные ответы, которые повторялись в нескольких наборах данных. Интересная деталь: в некоторых случаях простое объединение данных или усреднение весов моделей оставляло вред, а этот способ — уже нет.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. Проверки делали в контролируемых сценариях на языковых моделях, а не в реальном использовании, поэтому результат выглядит убедительно как направление защиты, но его ещё нужно подтверждать на более разнообразных данных и задачах.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас28 июля 2026 г.
Дата источника25 июля 2026 г.
ОригиналОткрыть
АвторыAdhyyan Narang, Artin Tajdini, Claire Zhang, Jamie Morgenstern