Препринт — материал ещё не прошёл рецензирование
Модели ИИ распознавали диабетическую ретинопатию по снимкам глаз
Кратко
Авторы проверили несколько моделей ИИ на снимках глаз из двух наборов данных. На внешнем наборе лучшая модель получила AUROC 0,920 — показатель того, насколько хорошо она различала снимки с ретинопатией и без неё. Адаптация LoRA требовала меньше вычислений, чем полная перенастройка модели.
Зачем это знать
Результат даёт ориентир для разработки автоматической проверки снимков глаз. Но это препринт: оценка проведена только на наборах данных и не подтверждает безопасную работу системы в клиниках или для каждого пациента.
Разбор
Авторы сравнили не одну модель, а три разных основы для анализа изображений: DINOv2, CLIP и Vision Transformer. Каждую адаптировали тремя способами: полностью переобучали под задачу, обучали только небольшой финальный слой или применяли LoRA — метод, который добавляет к большой модели небольшие обучаемые компоненты, не меняя все её параметры. Так исследователи проверили не только точность, но и цену настройки модели.
Сначала модели обучали и проверяли на наборе ODIR, а затем переносили на другой набор — APTOS. Такая внешняя проверка важна: изображения из нового источника показывают, не выучила ли система особенности только одного набора данных. На ODIR лучше всего сработала связка DINOv2 и LoRA, а на APTOS лидировали полностью дообученные DINOv2 и ViT; их результаты отличались лишь очень немного.
Авторы отдельно проверили, насколько честно модель оценивает собственную уверенность. Для этого они применили изотоническую регрессию — способ подправить вероятности так, чтобы заявленные 80% уверенности примерно соответствовали 80% правильных ответов. Кроме того, исследователи посмотрели, куда именно модель «смотрит»: карты внимания Grad-CAM и HiResCAM сравнили с разметкой поражений сетчатки, которую подготовили эксперты в наборе IDRiD. Это позволяет оценить не только ответ системы, но и его связь с действительно важными участками снимка.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его выводы ещё не прошли полноценную проверку рецензентами. Модели проверяли на наборах изображений, а не в клиническом процессе; сами авторы отмечают необходимость многоцентровых и проспективных испытаний — проверок в разных клиниках и в реальном времени обследования пациентов.
Пересказано ИИ по научной статье. Как это устроено