ИИ-помощь врачам в Кении не снизила число ошибок лечения
Кратко
В 16 первичных клиниках Кении врачи работали с электронной картой пациента с помощью большой языковой модели или без неё. За 14 дней серьёзной разницы в неудачах лечения не было: 2,2% в группе с ИИ против 2,0% в контроле. При этом помощь ИИ не вызвала сигналов безопасности.
Как это использовать
Для клиник это значит, что такая помощь пока не доказала заметной пользы в реальной работе: если эффект и есть, он, вероятно, небольшой. Но само испытание показывает, что внедрять ИИ в первичную помощь можно без явных проблем с безопасностью.
Разбор
Авторы проверили не ИИ вообще, а вполне конкретный сценарий: может ли большая языковая модель подсказать клиническому работнику, что делать с пациентом прямо в электронной карте. Для этого они устроили кластерное рандомизированное испытание: целые клиники, а не отдельных пациентов, случайно разделили на две группы — с подсказками ИИ и без них. Такой дизайн нужен, чтобы врачи из одной клиники не смешивали два подхода между собой и чтобы сравнение было честным.
Почему это было важно? Потому что в реальной первичной помощи, особенно там, где ресурсов мало, хорошие доказательства для таких систем почти отсутствуют. В Кении это особенно чувствительный вопрос: нагрузка на врачей высокая, а любая цифровая помощь должна не только звучать умно, но и реально менять исходы лечения. Исследователи проверяли не абстрактную «полезность», а очень приземлённый итог — были ли в течение 14 дней случаи неудачи лечения, которые отдельно оценивали эксперты.
И вот тут результат оказался довольно сдержанным: число неудач лечения почти не отличалось между группами. То есть ИИ не дал заметного выигрыша в самой важной для пациента вещи — исходе лечения в ближайшие две недели. При этом есть и хорошая новость: независимая проверка не нашла проблем с безопасностью, а серьёзных нежелательных событий, связанных именно с вмешательством, не было. Так что картина получилась не «ИИ спасает» и не «ИИ мешает», а скорее «внедрять можно, но рассчитывать на большой эффект пока не стоит».
Интересная деталь в том, что исследование было прагматичным — то есть максимально приближенным к обычной работе клиник, а не к стерильным условиям эксперимента. Именно поэтому его результаты так полезны: они показывают, что система может работать в реальной, небогатой ресурсами среде, но её клиническая отдача пока выглядит небольшой.
Ключевые цифры
Можно ли доверять
Это рецензируемая статья в Nature Medicine, так что работа прошла экспертную проверку до публикации. Испытание большое и практическое: почти 10 тысяч пациентов и 103 клинических работника в 16 клиниках — это уже серьёзный масштаб. Но исследование шло только в одной стране и оценивало короткий срок наблюдения, поэтому для других систем здравоохранения и более долгого периода выводы могут быть не такими же.
Пересказано ИИ по научной статье. Как это устроено