Препринт — материал ещё не прошёл рецензирование
Небольшие ИИ-модели хорошо узнают виды, но теряются на снимках фотоловушек
Кратко
В задаче с 96 видами четыре небольшие модели, работающие локально без постоянного интернета, распознавали животных заметно лучше случайного выбора. На качественных фотографиях специализированная модель BioCLIP с 300 млн параметров опередила проверенные модели на 33,2–59,2 процентного пункта, но на снимках фотоловушек все модели теряли 9,6–26,6 пункта точности.
Зачем это знать
Для автономных камер важны не только размеры модели и её знания: качество полевых снимков может стать главным узким местом. Вывод пока относится к 96 видам и шести наборам снимков, поэтому переносить его на любые условия рано.
Разбор
Авторы проверяли модели в условиях, похожих на работу настоящей фотоловушки: запускали их локально, без облака, в сжатом формате Q4 и с одинаковыми настройками. Для сравнения брали не только готовые кадры с животными, но и три варианта изображения — аккуратный фрагмент с животным, полный кадр и полный кадр с обозначенной рамкой. Это помогло отделить проблему знаний модели от проблемы самого снимка: если животное маленькое, скрыто или плохо различимо, даже специализированная система сталкивается с тем же препятствием.
Сравнение устроили на двух независимых наборах. В одном случайно выбрали фотографии, а в другом взяли по 20 снимков каждого из 18 видов, чтобы честнее сравнить виды между собой. В основном тесте модели должны были выбрать ответ из списка всех 96 видов; в дополнительном режиме список убирали. Тогда выяснилось, что от 5,9 до 9,6% ответов выглядели как правильно оформленные названия, но обозначали несуществующие с точки зрения этой классификации виды. Порядок моделей по склонности к таким выдуманным ответам совпал в обоих наборах — это надёжнее, чем один случайный процент.
Есть и практическая деталь для владельцев устройств: самая крупная модель занимала 6,1 ГБ памяти и иногда переносила часть работы на процессор, поэтому размер модели сам по себе ещё не означает удобство для автономной камеры. Даже 4B-модель превышала ориентир в 4 ГБ, а 2B была к нему лишь близка. В итоге авторы связывают преимущество BioCLIP прежде всего с тем, на каких данных её обучали, а не с количеством параметров. При этом переход от качественных снимков к полевым ухудшал результат и у неё, что указывает на общий барьер качества изображения.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому независимая проверка рецензентами ещё впереди. Сильная сторона работы — одинаковые изображения и два независимых набора для сравнения, но тест всё равно ограничен 96 видами и конкретными коллекциями фотоловушек; в других регионах, условиях съёмки или на другом оборудовании результаты могут отличаться.
Пересказано ИИ по научной статье. Как это устроено