Препринт — материал ещё не прошёл рецензирование
Персональная настройка помогла ИИ лучше выполнять задачи пользователя
Кратко
В препринте метод проверили на 30 людях и 600 заданиях в написании текстов и визуальном творчестве. После десятков заданий успешность выросла на 4,5–20,9%, а уточняемые критерии оценки находили на 16,0–22,3% больше ошибок, чем модели или люди по отдельности. Улучшение до 8,8% сохранялось и для других пользователей.
Зачем это знать
Работа намечает путь к ИИ, который подстраивается не под усреднённые предпочтения, а под личные требования человека. Но это предварительный результат небольшой проверки в двух областях: исследование ещё не прошло независимую проверку, и неизвестно, сохранится ли эффект для других задач и пользователей.
Разбор
Проблема здесь не в том, что ИИ совсем не умеет писать или создавать изображения. Он хорошо учится на массовых примерах, но профессионалу часто нужны свои, неочевидные стандарты: что считать удачным тоном, композицией или уровнем проработки. Такие требования трудно полностью описать до начала работы — зато человек снова и снова показывает их в правках и оценках результата.
Авторы предлагают использовать эту историю взаимодействий прямо во время работы системы. Агент — ИИ, который выполняет цепочку действий для решения задачи — сохраняет замечания пользователя в своём рабочем контексте, а иногда меняет и внутренние параметры базовой языковой модели. Параллельно отдельный модуль-оценщик постепенно собирает из правок понятные правила проверки: не только «хорошо или плохо», а список конкретных критериев, по которым можно искать ошибки в новых результатах.
Исследователи сравнили два способа адаптации — через накопленный контекст и через изменение параметров модели — и отдельно посмотрели, какие знания система усваивает. Выяснилось, что персональная настройка может захватывать сразу два уровня: общие правила, полезные нескольким людям, и индивидуальные требования конкретного пользователя. Это важно для открытых задач, где нет одного правильного ответа и где качество обычно оценивают не по готовому эталону, а по профессиональному суждению.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому независимая проверка ещё впереди. Кроме того, в абстракте указаны 30 участников, а в дополнительном описании — 20 экспертов; такую разницу стоит прояснить, прежде чем считать выводы окончательными.
Пересказано ИИ по научной статье. Как это устроено