dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

ИИ стал лучше замечать ошибки в незнакомых процедурах по видео

0

Кратко

Авторы доработали ИИ, который смотрит видео и проверяет, правильно ли выполнен каждый шаг инструкции, в том числе в процедурах, с которыми модель раньше не встречалась. На одном из тестов по таким процедурам этот подход обошёл лучший прежний способ максимум на 11,6%; оценка проходила на наборе задач, а не в реальных условиях.

Зачем это знать

Если результат подтвердится независимыми проверками, такой подход может приблизить системы, способные проверять выполнение новых инструкций без отдельного обучения для каждой процедуры. Пока это ранний результат, поэтому применять его как готовый инструмент рано.

Разбор

Проблема прежних систем в том, что они обычно запоминают конкретный набор действий: если процедура меняется, для неё приходится собирать новые примеры и заново обучать модель. Авторы предлагают проверять не знакомство с самим действием, а соответствие между текстом шага и тем, что происходит на видео. Для этого они создали протокол MD-VQA — единый способ проверять, понял ли ИИ, выполнен ли шаг правильно, причём отдельно для уже знакомых и новых действий.

Главное изменение касается дообучения видеоязычной модели — системы, которая одновременно обрабатывает видео и текст. Авторы добавили специальную «награду»: она поощряет модель, когда та находит именно расхождение между инструкцией и записью, а не просто угадывает ответ по похожим словам или сценам. Например, видео с разогревом духовки до 150 °C должно считаться ошибочным для инструкции разогреть её до 200 °C — внешне эти два эпизода почти одинаковы, но важна конкретная деталь.

Подход сравнили сразу с несколькими вариантами: моделью без дополнительного обучения, обычным дообучением на примерах вопросов и ответов, режимами с пошаговым объяснением рассуждений и другими способами постобучения. На новых для модели процедурах он дал преимущество до 11,6% над самым сильным из прежних методов. Авторы также опубликовали код и тестовый набор, чтобы другие исследователи могли воспроизвести сравнение.

Ключевые цифры

11,6%На процедурах, которых модель раньше не видела, новый способ показал результат максимум на 11,6% лучше лучшего сравниваемого метода.

Можно ли доверять

Это препринт на arXiv, поэтому работу ещё не прошла независимая журнальная рецензия. Модель проверяли на тестовом наборе видео, а не во время реального выполнения процедур; кроме того, в абстракте не указаны размер набора и подробности того, насколько разнообразны эти процедуры.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас31 августа 2026 г.
Дата источника28 августа 2026 г.
ОригиналОткрыть
АвторыFederico Spurio, Olga Zatsarynna, Lars Doorenbos, Emad Bahrami, Gianpiero Francesca, Juergen Gall