dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

Обучение без обмена данными немного улучшило прогноз болезней сердца

0

Кратко

Авторы обучили модель на двух больших наблюдательных группах людей из Нидерландов: Lifelines и Rotterdam Study. При таком совместном обучении без передачи личных данных качество прогноза немного выросло по сравнению с обучением внутри каждой группы отдельно.

Зачем это знать

Это указывает, что больницы и исследовательские центры могут обучать модели совместно, не передавая данные пациентов. Но эффект пока небольшой, а результат еще нужно проверить в других исследованиях.

Разбор

Авторы попробовали не свозить данные в одно место, а обучать модель сразу на двух разных группах людей, у каждой из которых свои особенности. Для этого они использовали федеративное обучение — подход, при котором модель учится на разных площадках, а сами данные пациентов никуда не переезжают. Это важный обходной путь для медицины: обычно такие совместные проекты тормозят правила приватности и разница между базами данных.

Здесь базы были не совсем одинаковыми. В Lifelines было намного больше людей, но исходы там были самоперемеченными, то есть сообщенными самими участниками. В Rotterdam Study людей было меньше, зато исходы подтягивались из цифровых клинических записей, и именно эту группу авторы использовали для основной проверки, потому что за ней было полнее наблюдение. Перед обучением на каждом узле отдельно заполняли пропуски в данных и несколько раз случайно делили выборку на тренировочную, проверочную и тестовую части, чтобы не ловить удачу на одном-единственном разбиении.

Что получилось: после федеративного обучения модель лучше различала тех, у кого болезнь разовьется, и тех, у кого нет, чем модель, обученная только на локальных данных без обмена знаниями. Улучшение было небольшим, но стабильным в обеих когортах. Это хороший знак для реального мира: разные больницы и центры могут совместно строить более сильные модели, даже если им нельзя передавать данные пациентов напрямую.

Ключевые цифры

148,230 участниковНа большой группе модель училась на данных очень многих людей, так что это не проверка на случайной маленькой выборке.
10,155 участниковВторую группу использовали как более строгую проверку: людей там меньше, но за ними лучше прослеживались исходы.
0.728 → 0.739После совместного обучения модель стала точнее на одной из групп, то есть чаще правильно различала высокий и низкий риск.
0.783 → 0.787На второй группе улучшение тоже было, но совсем небольшое — почти на грани заметности.

Можно ли доверять

Это препринт на arXiv, значит, статью еще не прошли рецензенты. Зато авторы проверили подход на двух реальных когортах людей и повторили оценку 10 раз, что делает выводы крепче, чем в одиночном тесте. При этом прирост качества небольшой, а одна из групп опиралась на самосообщенные исходы, так что результат лучше считать многообещающим, но не окончательным.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас12 июля 2026 г.
Дата источника9 июля 2026 г.
ОригиналОткрыть
АвторыHyunho Mo, Djura Smits, Mahlet A. Birhanu, Maarten J. G. Leening, Daniel Bos, Pim van der Harst, Esther E. Bron