dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Текстовые правила помогли ИИ чаще правильно отвечать на тестах ультраредких болезней

0

Кратко

PIHF хранит изменения не во внутренних настройках ИИ, а в текстовых правилах и наборе инструментов. Модель-критик и клинический эксперт находят повторяющиеся ошибки, после чего эксперт решает, принять ли новую версию правил или откатить её. На тестах ультраредких заболеваний такой подход повысил долю правильных диагнозов с первой попытки на 32,7 пункта для GPT-5.4 и на 31,1 пункта для Qwen3.6-35B.

Зачем это знать

Это ранний результат на тестовых задачах, а не доказательство готовности к работе с пациентами: перенос на клиническую практику не проверяли, а условия части оценки не раскрыты. Если подход подтвердится в независимых испытаниях, ИИ можно будет улучшать через управляемые текстовые правила, не меняя веса самой модели.

Разбор

Авторы не дообучали саму языковую модель. Вместо этого они вынесли долгосрочные изменения в отдельный набор текстовых правил и инструментов, где каждую версию можно сохранить, сравнить с предыдущей и при необходимости откатить. Модель при этом остаётся неизменной и каждый раз выполняет текущую версию правил.

Сначала система разбирает не только итоговый ответ, но и весь ход рассуждения вместе с использованием инструментов. Модель-критик ищет повторяющиеся сбои, а клинический эксперт формулирует возможную правку и решает, пропускать ли её в рабочую версию. Это важная деталь: автоматическая система не получает права бесконтрольно менять собственные инструкции. Затем новую версию запускают на задачах и сравнивают результаты по Recall@1 — правильный диагноз оказался первым вариантом — и Recall@5 — попал в пятёрку вариантов.

Такой подход проверили не на одной конкретной модели: авторы провели серию поэтапных сравнений на одном закрытом исполнителе и трёх открытых моделях с разным размером. Результат оказался устойчивым между системами, хотя разрыв между двумя приведёнными в абстракте моделями составил 1,7 процентного пункта. Раньше подобную адаптацию обычно связывали с изменением параметров модели или с временными подсказками в контексте; здесь проверяют другой вариант — развивать внешний, управляемый слой правил, оставляя базовую модель фиксированной.

Ключевые цифры

3–49 млрд активных параметровПодход проверили на моделях от относительно компактных до очень крупных, поэтому результат не привязан к одному размеру системы.
4 исполнителяАвторы сравнили один закрытый и три открытых варианта, а не сделали вывод по единственной модели.
1,7 процентного пунктаИтоговая разница между двумя указанными улучшениями невелика по сравнению с самим эффектом, поэтому модели показали близкий результат.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая обычное рецензирование. Проверка прошла на тестах ультраредких заболеваний и нескольких моделях, но не на реальных пациентах; кроме того, часть условий оценки закрыта, поэтому перенос результата в клиническую работу пока не подтверждён.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас18 августа 2026 г.
Дата источника17 августа 2026 г.
ОригиналОткрыть
АвторыMinh-Ha Nguyen, Cathy Shyr