Препринт — материал ещё не прошёл рецензирование
Каждая третья заметка ИИ-секретаря содержала подтверждённую ошибку
Кратко
В препринте с аудитом трёх коммерческих ИИ-секретарей использовали 142 консультации и 565 заметок. Чаще всего искажались сведения об аллергиях и лекарствах, выдумывались личность пациента и даты, а рассказ с телефонного разговора записывался как результат осмотра. Если не считать ошибки, которые могла бы предотвратить медицинская карта, доля составила 24,8%.
Зачем это знать
Такие ошибки могут попадать в записи о пациентах. Но этот аудит — временный снимок трёх продуктов, а исследователи не измеряли, как часто клиницисты замечают подобные ошибки при обычной проверке.
Разбор
Авторы не просто перечитали готовые заметки, а построили многоступенчатую проверку. Сначала 12 проходов поиска собрали все подозрительные места в текстах. Затем оставили ошибки, которые прошли фильтр важности, и отправили их двум ИИ-моделям разных семейств с противоположной задачей: не подтвердить находку, а попытаться её опровергнуть. В итог попали только случаи, пережившие такую проверку; для каждого сохранили цитату из расшифровки разговора, на которой основан вывод.
Отдельно авторы проверили, насколько сам способ аудита влияет на результат. При одинаковых заметках, моделях и исходных данных доля подтверждённых ошибок среди найденных кандидатов менялась от 9,3% до 79,0% только из-за формулировки инструкции проверяющему. Менялся результат и при замене семейства модели: одна система сочла ошибочным содержание 54,8% заметок, другая — 27,8%. Поэтому цифра зависит не только от качества секретаря, но и от того, насколько строгой получилась проверка.
Два врача вслепую оценили отдельные наборы находок: один подтвердил 20 из 21, независимый от авторов клиницист — все 12 из 12. При этом исследователи нашли ещё один тип сбоя, который не вошёл в их основную схему: врач отменяет назначение во время разговора, а секретарь записывает его как проведённое лечение. Полные тексты заметок не опубликовали из-за разных условий использования продуктов, зато выпустили доказательства со стороны расшифровок, версии моделей, инструкции и воспроизводимый код. Это позволяет повторить аудит на новых версиях сервисов, хотя сравнить по опубликованным материалам конкретные продукты между собой нельзя.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, а не статья, прошедшая обычное рецензирование. Аудит опирается на 142 консультации и слепую проверку врачами, но продукты анонимны, их заметки не опубликованы, а исследователи не измеряли, какие ошибки клиницисты реально замечают при обычной работе. Важно и то, что сами авторы показывают сильную зависимость результата от метода проверки.
Пересказано ИИ по научной статье. Как это устроено