Препринт — материал ещё не прошёл рецензирование
Модели ИИ осторожно оценивали рецепты для людей с диабетом
Кратко
Авторы проверили, как текстовые ИИ-модели оценивают 7607 рецептов: 3807 считались подходящими для людей с диабетом, а 3800 — неподходящими. Когда моделям явно давали рекомендации по питанию при диабете, они справлялись лучше; среди проверенных моделей особенно хорошо выступили Mistral-7B и Llama 3.1 70B.
Зачем это знать
Результат показывает, что ИИ может разбирать рецепты по заданным правилам, но пока не подтверждает его безопасность для решений о питании пациентов: модели проверяли на заранее размеченных рецептах, а не в реальных медицинских ситуациях.
Разбор
Авторы проверяли не способность ИИ придумать меню, а более узкую задачу: взять готовый рецепт, разобрать его на продукты и способ приготовления, найти в нём важные для диабета признаки и вынести решение. Для этого они использовали три варианта запроса. В первом модель получала только вопрос о подходящем рецепте, во втором — выдержки из рекомендаций по питанию, а в третьем — ещё и примеры, показывающие, как применять эти рекомендации.
Такой подход позволил отделить знания модели от умения пользоваться правилами. В объяснениях моделей искали признаки вроде полезных углеводов, трансжиров и холестерина — то есть проверяли не только итоговую метку, но и связь решения с понятиями из рекомендаций. Большинство систем чаще называли рецепт неподходящим, чем подходящим: похоже, они старались не объявить потенциально вредную еду безопасной. Поэтому у многих моделей точность таких осторожных ответов была выше, чем способность находить все подходящие рецепты.
До этого ИИ в основном оценивали по задачам планирования питания, где результатом становилось готовое меню. Здесь авторы создали отдельную проверку именно для классификации рецептов и сравнили, меняется ли качество ответа, если дать модели медицинский контекст. Запуски проводили на отдельных рецептах; большинство моделей работало локально на машинах с восемью видеокартами V100, а ChatGPT-3.5 подключали через API. Это технический тест рассуждения по тексту, а не консультация пациента.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, поэтому работу ещё не проверили рецензенты. Тест был воспроизводимым сравнением моделей на заранее подготовленных текстовых примерах, но он не показывает, как ИИ поведёт себя с реальными пациентами, неполными данными о здоровье или индивидуальными назначениями.
Пересказано ИИ по научной статье. Как это устроено