dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Метод для видео-моделей снижает галлюцинации в тестах

0

Кратко

MultiToP — это способ подправлять визуальные токены в видео-мультимодальных моделях перед генерацией ответа. В экспериментах на бенчмарках он уменьшал галлюцинации и при этом не ухудшал общее понимание видео, а на отдельных моделях даже улучшал метрики.

Зачем это знать

Это может быть полезно для разработки более надёжных видео-моделей, но пока выводы основаны на препринте и тестах на конкретных бенчмарках. Поэтому к результатам стоит относиться как к раннему подтверждению идеи, а не как к готовому решению для практики.

Разбор

Авторы взяли видео-модель и не стали переучивать её целиком. Вместо этого они вставили маленький «латочный» модуль, который перед генерацией ответа смотрит на визуальные токены — то есть на внутренние представления кадров — и заменяет те из них, в которых модель не уверена, на более общий запасной токен. Идея простая: если модель цепляется за плохую визуальную подсказку, лучше подправить именно её, чем трогать всю систему.

Чтобы этот модуль понимал, какие токены стоит менять, его учили не вслепую. Для этого использовали подсказки, связанные с правильным ответом, и сигналы по отдельным кадрам, которые берут из самой базовой модели. Плюс добавили штраф за слишком частые замены, чтобы модуль работал точечно, а не переписывал всё подряд. Важный момент: исходную видео-модель во время обучения замораживали, так что донастраивали только этот небольшой блок.

На тестах метод снижал галлюцинации — то есть случаи, когда модель уверенно говорит то, чего нет на видео. При этом он не ломал общее понимание видео: на одном наборе задач качество даже выросло. Ещё авторы проверили, что дополнительная нагрузка на вычисления почти не растёт, так что подход задуман именно как лёгкая надстройка поверх уже готовых моделей, а не как тяжёлый новый движок.

Интересно и то, что сравнивали метод не с одним соперником, а с несколькими сильными способами вмешательства во время ответа. То есть это не просто «стало лучше по сравнению с базовой версией», а попытка показать, что точечная правка визуальных токенов может быть практичнее других похожих приёмов.

Ключевые цифры

3 000 примеровИменно на таком небольшом, но реальном наборе обучали модуль, а значит решение пока опирается не на огромный массив данных.
50.60%На одном из тестов число ошибок-галлюцинаций заметно сократилось — почти в полтора раза по сравнению с обычной моделью.
18.58%На другом тесте модель не только не испортила понимание видео, но и стала заметно точнее.
32Столько самых важных визуальных элементов оставляли в фокусе при работе метода — это помогает ему быть точечным, а не грубым.

Можно ли доверять

Это препринт на arXiv, значит работу ещё не проверяли независимые рецензенты. Проверяли метод не на живых пользователях, а на бенчмарках и нескольких конкретных моделях, поэтому эффект может быть сильнее или слабее в других условиях. При этом авторы сравнили подход с рядом современных методов и отдельно показали, что он почти не добавляет вычислительной нагрузки — это хороший знак для реалистичности результата.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас11 июня 2026 г.
Дата источника10 июня 2026 г.
ОригиналОткрыть
АвторыYuansheng Gao, Wenbin Xing, Jiahao Yuan, Kaiwen Zhou, Han Bao, Zonghui Wang, Wenzhi Chen