dumai
ИИПрепринтHugging Face Daily Papers

Препринт — материал ещё не прошёл рецензирование

LLM-судьи завышают новизну научных вопросов

0

Кратко

На материале свежих arXiv-работ авторы сравнили вопросы, созданные моделью, с вопросами, привязанными к реальным статьям. LLM-судьи стабильно считали сгенерированные вопросы очень новыми, тогда как эксперты-область предпочитали авторские опорные вопросы.

Зачем это знать

Это предупреждает, что оценки новизны от LLM могут давать ложное чувство уверенности. Для оценки научных идей такие судьи пока выглядят ненадёжно, особенно в задачах, где важны тонкие различия между оригинальностью, узостью и привязкой к источникам.

Разбор

Но люди-эксперты увидели обратную картину и чаще предпочитали именно авторские вопросы из статей. Ещё одна важная деталь: многие сгенерированные вопросы были либо слишком узкими, либо слишком жёстко привязанными к исходным источникам, и LLM-судьи часто это не замечали, если не заставлять их проверять именно этот аспект. То есть проблема не только в том, что модель «щедра» на оценку новизны, а в том, что она может пропускать более тонкие вещи: насколько вопрос действительно самостоятельный и не висит ли он слишком сильно на конкретном наборе источников.

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверили независимые рецензенты. Зато авторы сравнивали не абстрактные примеры, а вопросы по свежим статьям и подключили экспертов из предметной области, так что выводы выглядят содержательно. Но это всё ещё оценка на одном типе задач — на вопросах, а не на полном цикле научной идеи, поэтому переносить результат на все виды «новизны» стоит осторожно.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (via Hugging Face)
Дата публикации у нас11 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыSoumitra Sinhahajari, Navonil Majumder, Soujanya Poria