Препринт — материал ещё не прошёл рецензирование
Без поиска ИИ часто советует не тех врачей и фирмы с нарушениями
Кратко
Авторы проверили рекомендации ИИ для четырёх видов услуг в 100 крупнейших городских районах США. Без обращения к интернету с реальными врачами в нужном городе совпадали лишь 4% рекомендаций одной системы и 11% другой; при обращении к интернету — 64–71%. Без поиска финансовые фирмы с записями о нарушениях у американского регулятора встречались в рекомендациях в 3,6 раза чаще, чем их доля в реестре, а сами ответы обычно не предупреждали о непроверенности советов. Это результаты препринта, ещё не прошедшие независимую рецензию.
Зачем это знать
Надёжность совета зависит не только от самого ИИ, но и от того, обращается ли он к доступным данным из интернета. Это особенно важно для рекомендаций, от которых зависят здоровье и деньги: уверенный ответ может не содержать признаков того, что его рекомендации не проверены. Результаты относятся к четырём типам услуг в США и могут не переноситься на другие страны, модели и области.
Разбор
Авторы не просто попросили модели назвать специалистов, а сверили каждый ответ с официальными реестрами. Для врачей они использовали записи Medicare, а для финансовых консультантов — раскрытия американского регулятора SEC. Проверка охватила врачей, медицинские учреждения, финансовые фирмы и рестораны в крупнейших городских районах США. Так исследователи отделили настоящую рекомендацию от совпадения имён или от названия, которое модель могла придумать.
Самое показательное сравнение — двух одинаковых запусков одной коммерческой модели: в одном случае поиск отключили, в другом включили. Значит, разницу можно связать именно с доступом к интернету, а не с другой моделью или другим вопросом. Для дополнительной проверки авторы использовали также модель с открытыми параметрами. Оказалось, что без поиска совпадения с реальными врачами иногда были лишь совпадениями имён: такие «совпавшие» специалисты не чаще оказывались врачами первичного приёма, чем случайно выбранные люди из реестра.
Отдельно проверили, не путает ли модель популярность с качеством. У рекомендованных ресторанов было в три–пять раз больше отзывов, чем у сравниваемых заведений, но средняя оценка отличалась не более чем на десятую долю звезды. Это похоже на выбор по заметности, а не на убедительное доказательство лучшего качества. По финансовым фирмам картина менялась ещё сильнее: без поиска система чаще выбирала фирмы с раскрытыми нарушениями, а при поиске этот перекос исчезал и становился ниже обычной доли таких фирм в реестре.
Авторы также показали практическое последствие: без поиска система лучше справлялась с крупнейшими городами, где о поставщиках услуг, вероятно, больше доступной информации, а в небольших агломерациях реальные совпадения встречались хуже. При включённом поиске эта зависимость от размера города в основном пропадала. При этом поиск заметно удорожал запуск: сервису приходилось отдельно оплачивать несколько обращений к интернету для каждого ответа.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому независимая рецензия ещё не проверила метод и выводы. Сильная сторона работы — сверка с официальными реестрами и прямое сравнение одной модели с включённым и выключенным поиском; но результаты относятся к четырём областям услуг в США, а часть сравнений сделана на разных наборах запросов.
Пересказано ИИ по научной статье. Как это устроено