dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Каждая третья заметка ИИ-секретаря содержала подтверждённую ошибку

0

Кратко

В препринте с аудитом трёх коммерческих ИИ-секретарей использовали 142 консультации и 565 заметок. Чаще всего искажались сведения об аллергиях и лекарствах, выдумывались личность пациента и даты, а рассказ с телефонного разговора записывался как результат осмотра. Если не считать ошибки, которые могла бы предотвратить медицинская карта, доля составила 24,8%.

Зачем это знать

Такие ошибки могут попадать в записи о пациентах. Но этот аудит — временный снимок трёх продуктов, а исследователи не измеряли, как часто клиницисты замечают подобные ошибки при обычной проверке.

Разбор

Авторы не просто перечитали готовые заметки, а построили многоступенчатую проверку. Сначала 12 проходов поиска собрали все подозрительные места в текстах. Затем оставили ошибки, которые прошли фильтр важности, и отправили их двум ИИ-моделям разных семейств с противоположной задачей: не подтвердить находку, а попытаться её опровергнуть. В итог попали только случаи, пережившие такую проверку; для каждого сохранили цитату из расшифровки разговора, на которой основан вывод.

Отдельно авторы проверили, насколько сам способ аудита влияет на результат. При одинаковых заметках, моделях и исходных данных доля подтверждённых ошибок среди найденных кандидатов менялась от 9,3% до 79,0% только из-за формулировки инструкции проверяющему. Менялся результат и при замене семейства модели: одна система сочла ошибочным содержание 54,8% заметок, другая — 27,8%. Поэтому цифра зависит не только от качества секретаря, но и от того, насколько строгой получилась проверка.

Два врача вслепую оценили отдельные наборы находок: один подтвердил 20 из 21, независимый от авторов клиницист — все 12 из 12. При этом исследователи нашли ещё один тип сбоя, который не вошёл в их основную схему: врач отменяет назначение во время разговора, а секретарь записывает его как проведённое лечение. Полные тексты заметок не опубликовали из-за разных условий использования продуктов, зато выпустили доказательства со стороны расшифровок, версии моделей, инструкции и воспроизводимый код. Это позволяет повторить аудит на новых версиях сервисов, хотя сравнить по опубликованным материалам конкретные продукты между собой нельзя.

Ключевые цифры

12 проходовПоиск ошибок повторили много раз разными способами, чтобы не зависеть от одной случайной формулировки запроса.
13 678 кандидатовСтолько подозрительных фрагментов нашли до строгой проверки — первоначальный поиск был гораздо шире итогового списка.
618 находокСтолько случаев осталось после фильтра важности и попыток двух ИИ-моделей опровергнуть каждую ошибку.
от 28% до 97% заметокИтоговая доля заметок с ошибкой резко менялась в зависимости от выбранного стандарта проверки.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая обычное рецензирование. Аудит опирается на 142 консультации и слепую проверку врачами, но продукты анонимны, их заметки не опубликованы, а исследователи не измеряли, какие ошибки клиницисты реально замечают при обычной работе. Важно и то, что сами авторы показывают сильную зависимость результата от метода проверки.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас6 сентября 2026 г.
Дата источника31 августа 2026 г.
ОригиналОткрыть
АвторыSebastian Fox, Luke Markham, Ryan Lail, Michael Karotsieris