dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

InnerExpert отмечает подозрительные фрагменты в ответах MoE-моделей за один проход

0

Кратко

Метод InnerExpert использует сигналы маршрутизации между внутренними «экспертами» модели и за один проход отмечает токены, похожие на галлюцинации. На пяти наборах данных и двух архитектурах с несколькими экспертами он достиг AUROC до 0,91 для ответа целиком и до 0,76 для отдельных токенов; AUROC — это метрика качества обнаружения, где большее значение означает лучший результат. Детектор обучали на оценках другой ИИ-модели, а не полностью вручную.

Зачем это знать

Это ранний результат препринта, испытанный лишь на пяти наборах данных и двух архитектурах. Он указывает на способ проверять ответы по частям, но пока не подтверждает надёжность такого детектора для других моделей.

Разбор

Проблема здесь не только в том, чтобы понять, ошибся ли ответ целиком. Важно ещё показать конкретное место, где модель начала выдумывать: например, отдельное слово или короткий фрагмент. Раньше такие проверки чаще работали на уровне всего ответа или предложения, поэтому они плохо подходили для точечного вмешательства.

Авторы использовали особенность MoE-моделей — архитектур, где разные части сети называют «экспертами», а специальный маршрутизатор решает, какие из них подключить для каждого токена. Они собрали признаки из этого внутреннего процесса: насколько неуверенно маршрутизатор выбирает экспертов, насколько эксперты расходятся между собой и какие эксперты срабатывают чаще. К ним добавили обычные сигналы трансформера и получили компактное описание каждого токена.

Затем лёгкий классификатор учился по разметке, которую создавал конвейер с другой языковой моделью в роли судьи. Это позволяет обновлять детектор без ручной проверки каждого примера, хотя качество такой разметки зависит от самого ИИ-судьи. На всех проверках InnerExpert оказался лучше методов сравнения и смог оценивать не только ответ целиком, но и отдельные фрагменты, используя один проход исходной модели.

Ключевые цифры

0,91Такое значение для ответа целиком означает, что детектор довольно хорошо отделяет ответы с выдумками от ответов без них по сравнению со случайным угадыванием.
0,76Для отдельных токенов результат заметно сложнее, но детектор всё же способен находить подозрительные места лучше случайного выбора.
5 наборов данныхМетод проверили на нескольких разных тестах, а не на одном специально подобранном примере.
2 MoE-архитектурыРезультат получили не на единственной конструкции модели, хотя проверка всё равно остаётся ограниченной.

Можно ли доверять

Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Проверка прошла на пяти наборах данных и двух архитектурах, а обучающие метки создавала другая ИИ-модель, не люди; пока неясно, насколько хорошо метод перенесётся на другие MoE-модели и реальные пользовательские ответы.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас19 августа 2026 г.
Дата источника18 августа 2026 г.
ОригиналОткрыть
АвторыJoao Fonseca, Rodrigo Rodrigues, Paolo Romano