dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Шесть ИИ-моделей плохо диагностируют сбои и выбирают, когда просить помощи

0

Кратко

В симуляции шесть открытых ИИ-моделей плохо определяли по изображениям, почему робот не справился: ответы менялись от формулировки запроса, а уверенность не указывала на правильность. Текстовое описание данных о силе иногда улучшало результат, а после одного вопроса человеку точность среди таких случаев достигала 0,70–0,81.

Зачем это знать

Работа показывает ограничение таких моделей: по одним изображениям они не всегда могут надёжно определить причину сбоя и выбрать момент для обращения к человеку. Результат получен на искусственных отказах в симуляции; это препринт, поэтому перенос на реальных роботов пока не установлен.

Разбор

Авторы сделали симулятор, где причину каждого отказа заранее задавали сами — например, имитировали проблему с захватом или приложенной силой. Это позволило точно проверить, что действительно можно понять по восьми кадрам с камеры, а что требует других показаний, и отдельно убедиться, что ответ не подсказывает модели правильный вариант через утечку данных. В качестве ориентира использовали простые классификаторы, которые получают те же эпизоды, что и модели.

Главный результат оказался не только в низкой точности. Камеры в принципе не содержали достаточно информации о части отказов: по данным о силе такие случаи определялись почти идеально, а по изображению — нет. Когда исследователи передавали моделям сводку показаний силы в виде десяти строк текста, у четырёх из шести моделей появились результаты выше уровня случайного базового варианта. Значит, в некоторых случаях проблема была не в полной неспособности рассуждать, а в том, что нужный сигнал просто отсутствовал во входных данных.

Затем авторы превратили восстановление после сбоя в выбор из трёх действий: продолжить работу по собственной версии причины, запросить данные другого датчика или позвать человека. Этот выбор проверяли при разной цене обращения за помощью. Модели не меняли частоту просьб о помощи так, как требовала бы такая цена, и переносили ответ вместе с позицией варианта в списке: один и тот же отказ от ответа мог почти исчезнуть, если переставить его с последнего места на первое. Авторы также проверили несколько способов измерить уверенность — от оценки по шкале до повторяемости ответа, — но ни один не показал, будет ли диагноз правильным.

Ключевые цифры

0.99По данным о силе один из типов отказа удавалось распознавать почти без ошибок — это показывает, насколько важен выбор датчика.
0.55Лучший результат по изображениям для тех же случаев был не выше 55%, поэтому одной камеры часто недостаточно.
78–100% → 0–6%В трёх проверенных сочетаниях модели и семейства перестановка варианта в списке почти полностью меняла готовность признать, что ответа нет.
4 разаКогда стоимость вопроса человеку меняли в четыре раза, частота обращений моделей практически не следовала этой разнице.

Можно ли доверять

Это препринт с arXiv, поэтому независимая проверка рецензентами ещё впереди. При этом эксперимент прозрачно устроен: причины отказов в симуляции известны заранее, а утечку данных отдельно контролировали. Но выводы относятся к шести открытым моделям и искусственным эпизодам; две модели используют родственные архитектурные решения, а часть тестов прошла не для всех участников.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас21 сентября 2026 г.
Дата источника18 сентября 2026 г.
ОригиналОткрыть
АвторыEshika Pathak, Leela Krishna