Препринт — материал ещё не прошёл рецензирование
GS-MoE обнаружила шесть редких патологий, где другие модели не нашли правильных случаев
Кратко
На тестах RadImageNet — коллекции из 1,35 млн изображений трёх типов — GS-MoE вернула обнаружение шести редких патологий: у всех сравниваемых моделей показатель качества F1 для этих классов был равен нулю. При этом на один запуск ей требовалось примерно на 53% меньше параметров, задействованных в работе, чем самой сильной обычной модели, использующей все параметры.
Зачем это знать
Система совмещает обработку общих признаков разных типов снимков с отдельной обработкой признаков каждого типа. Но результат получен только на одном тестовом наборе и не говорит о готовности технологии к применению в больницах.
Разбор
Авторы пытались решить конфликт между двумя полезными стратегиями. Одной части модели нужно учиться общим признакам, которые встречаются на КТ, МРТ и УЗИ, а другой — учитывать особенности каждого типа снимков. В GS-MoE для этого сделали две ветви: «универсальную» и три специализированные. Затем отдельный маршрутизатор определяет тип изображения и подключает нужного специалиста, а не заставляет всю большую модель работать целиком.
Модель обучали поэтапно. Сначала универсальная ветвь училась на всех 165 классах патологий, затем из неё создавали специализированные ветви и дообучали их отдельно, после чего все части настраивали вместе. Такой порядок оказался важен: без него две проверенные версии MoE заметно проседали — их общий показатель MCC составлял 0,639 и 0,691 против 0,770 у GS-MoE. Это показывает, что выигрыш связан не только с самой идеей маршрутизации, но и с тем, как модель обучали.
Особенно заметный эффект пришёлся на редкие классы: максимальная прибавка достигла 0,60 пункта F1 для отдельной патологии. При проверке модель включала универсальную ветвь, маршрутизатор и только одного специалиста; остальные параметры не участвовали в конкретном запуске. Маршрутизатор почти безошибочно различал тип снимка — его точность превышала 99,9%.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому его ещё не проверили независимые рецензенты. Модель оценивали на одном наборе данных и на тестовых изображениях, а не в работе с реальными пациентами; кроме того, авторы сравнивали несколько случайных запусков, но это не заменяет проверку в других клиниках и на других наборах.
Пересказано ИИ по научной статье. Как это устроено