Препринт — материал ещё не прошёл рецензирование
InnerExpert отмечает подозрительные фрагменты в ответах MoE-моделей за один проход
Кратко
Метод InnerExpert использует сигналы маршрутизации между внутренними «экспертами» модели и за один проход отмечает токены, похожие на галлюцинации. На пяти наборах данных и двух архитектурах с несколькими экспертами он достиг AUROC до 0,91 для ответа целиком и до 0,76 для отдельных токенов; AUROC — это метрика качества обнаружения, где большее значение означает лучший результат. Детектор обучали на оценках другой ИИ-модели, а не полностью вручную.
Зачем это знать
Это ранний результат препринта, испытанный лишь на пяти наборах данных и двух архитектурах. Он указывает на способ проверять ответы по частям, но пока не подтверждает надёжность такого детектора для других моделей.
Разбор
Проблема здесь не только в том, чтобы понять, ошибся ли ответ целиком. Важно ещё показать конкретное место, где модель начала выдумывать: например, отдельное слово или короткий фрагмент. Раньше такие проверки чаще работали на уровне всего ответа или предложения, поэтому они плохо подходили для точечного вмешательства.
Авторы использовали особенность MoE-моделей — архитектур, где разные части сети называют «экспертами», а специальный маршрутизатор решает, какие из них подключить для каждого токена. Они собрали признаки из этого внутреннего процесса: насколько неуверенно маршрутизатор выбирает экспертов, насколько эксперты расходятся между собой и какие эксперты срабатывают чаще. К ним добавили обычные сигналы трансформера и получили компактное описание каждого токена.
Затем лёгкий классификатор учился по разметке, которую создавал конвейер с другой языковой моделью в роли судьи. Это позволяет обновлять детектор без ручной проверки каждого примера, хотя качество такой разметки зависит от самого ИИ-судьи. На всех проверках InnerExpert оказался лучше методов сравнения и смог оценивать не только ответ целиком, но и отдельные фрагменты, используя один проход исходной модели.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Проверка прошла на пяти наборах данных и двух архитектурах, а обучающие метки создавала другая ИИ-модель, не люди; пока неясно, насколько хорошо метод перенесётся на другие MoE-модели и реальные пользовательские ответы.
Пересказано ИИ по научной статье. Как это устроено