Препринт — материал ещё не прошёл рецензирование
Обучение без обмена данными немного улучшило прогноз болезней сердца
Кратко
Авторы обучили модель на двух больших наблюдательных группах людей из Нидерландов: Lifelines и Rotterdam Study. При таком совместном обучении без передачи личных данных качество прогноза немного выросло по сравнению с обучением внутри каждой группы отдельно.
Зачем это знать
Это указывает, что больницы и исследовательские центры могут обучать модели совместно, не передавая данные пациентов. Но эффект пока небольшой, а результат еще нужно проверить в других исследованиях.
Разбор
Авторы попробовали не свозить данные в одно место, а обучать модель сразу на двух разных группах людей, у каждой из которых свои особенности. Для этого они использовали федеративное обучение — подход, при котором модель учится на разных площадках, а сами данные пациентов никуда не переезжают. Это важный обходной путь для медицины: обычно такие совместные проекты тормозят правила приватности и разница между базами данных.
Здесь базы были не совсем одинаковыми. В Lifelines было намного больше людей, но исходы там были самоперемеченными, то есть сообщенными самими участниками. В Rotterdam Study людей было меньше, зато исходы подтягивались из цифровых клинических записей, и именно эту группу авторы использовали для основной проверки, потому что за ней было полнее наблюдение. Перед обучением на каждом узле отдельно заполняли пропуски в данных и несколько раз случайно делили выборку на тренировочную, проверочную и тестовую части, чтобы не ловить удачу на одном-единственном разбиении.
Что получилось: после федеративного обучения модель лучше различала тех, у кого болезнь разовьется, и тех, у кого нет, чем модель, обученная только на локальных данных без обмена знаниями. Улучшение было небольшим, но стабильным в обеих когортах. Это хороший знак для реального мира: разные больницы и центры могут совместно строить более сильные модели, даже если им нельзя передавать данные пациентов напрямую.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, статью еще не прошли рецензенты. Зато авторы проверили подход на двух реальных когортах людей и повторили оценку 10 раз, что делает выводы крепче, чем в одиночном тесте. При этом прирост качества небольшой, а одна из групп опиралась на самосообщенные исходы, так что результат лучше считать многообещающим, но не окончательным.
Пересказано ИИ по научной статье. Как это устроено