Препринт — материал ещё не прошёл рецензирование
LLM-судьи завышают новизну научных вопросов
Кратко
На материале свежих arXiv-работ авторы сравнили вопросы, созданные моделью, с вопросами, привязанными к реальным статьям. LLM-судьи стабильно считали сгенерированные вопросы очень новыми, тогда как эксперты-область предпочитали авторские опорные вопросы.
Зачем это знать
Это предупреждает, что оценки новизны от LLM могут давать ложное чувство уверенности. Для оценки научных идей такие судьи пока выглядят ненадёжно, особенно в задачах, где важны тонкие различия между оригинальностью, узостью и привязкой к источникам.
Разбор
Но люди-эксперты увидели обратную картину и чаще предпочитали именно авторские вопросы из статей. Ещё одна важная деталь: многие сгенерированные вопросы были либо слишком узкими, либо слишком жёстко привязанными к исходным источникам, и LLM-судьи часто это не замечали, если не заставлять их проверять именно этот аспект. То есть проблема не только в том, что модель «щедра» на оценку новизны, а в том, что она может пропускать более тонкие вещи: насколько вопрос действительно самостоятельный и не висит ли он слишком сильно на конкретном наборе источников.
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не проверили независимые рецензенты. Зато авторы сравнивали не абстрактные примеры, а вопросы по свежим статьям и подключили экспертов из предметной области, так что выводы выглядят содержательно. Но это всё ещё оценка на одном типе задач — на вопросах, а не на полном цикле научной идеи, поэтому переносить результат на все виды «новизны» стоит осторожно.
Пересказано ИИ по научной статье. Как это устроено