Препринт — материал ещё не прошёл рецензирование
ИИ помогает искать слабые места в планах клинических испытаний
Кратко
Система из нескольких специализированных ИИ анализировала планы клинических испытаний и прошлые решения американского регулятора FDA. На 291 письме FDA она лучше прежних методов предсказывала технический и регуляторный успех, но при поиске недостатков пропускала примерно половину проблем, а примерно половина её предупреждений не совпадала с проблемами FDA.
Зачем это знать
Это ранняя проверка на небольшом наборе писем FDA: результаты показывают потенциал для вспомогательного анализа рисков, но точность поиска проблем пока недостаточна для самостоятельных решений о клинических испытаниях.
Разбор
Авторы собрали TrialAtlas как «исследовательскую команду» из нескольких ИИ. Один модуль ищет данные в научных публикациях, другой сравнивает похожие клинические испытания, третий изучает прошлые решения регулятора, а главный модуль сводит всё вместе. Важная деталь: система не просто выдаёт итоговый балл, а должна показать, на каких фактах и прецедентах основано каждое предупреждение — так эксперт может проверить ход рассуждений.
Для проверки авторы создали отдельный набор задач TrialAtlasBench на основе писем FDA, в которых регулятор объяснял отказ в одобрении препарата. Систему попросили сделать сразу три вещи: найти недостатки дизайна испытания, предложить конкретные улучшения протокола и оценить вероятность технического и регуляторного успеха. Такой подход отличается от прежних моделей, которые в основном пытались предсказать финальный исход испытания, не разбирая, какое именно решение в его дизайне могло привести к проблеме.
Помимо автоматических метрик, авторы попросили экспертов оценить сами предупреждения системы. Доля признанных обоснованными составила 86,4% — выше, чем у OpenAI DeepResearch и Gemini DeepResearch в этой проверке. Но это не означает, что ИИ правильно находит все проблемы: авторы прямо описывают TrialAtlas как инструмент первичного отбора вопросов для эксперта, а не как замену специалисту.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Проверка опирается на 291 письмо FDA — это полезный, но небольшой набор, причём FDA публикует сравнительно мало таких писем. Результаты поддерживают использование системы как помощника для сортировки рисков с обязательной проверкой экспертом, но не самостоятельные решения о дизайне испытаний.
Пересказано ИИ по научной статье. Как это устроено