Препринт — материал ещё не прошёл рецензирование
На связанных событиях языковые модели дают противоречивые прогнозы
Кратко
Моделям предлагали оценивать вероятность событий, связанных с изменением цен акций. Затем исследователи проверяли, можно ли составить набор ставок против этих оценок, который принёс бы прибыль при любом исходе. Несогласованность усиливалась при более сложных связях между событиями, а случайные детали запроса иногда увеличивали её в десять раз.
Зачем это знать
Работа показывает, что вероятностным оценкам языковых моделей нельзя автоматически приписывать внутреннюю согласованность. Но это препринт: выводы в основном основаны на прогнозах, связанных с доходностями акций, а результат может зависеть от формулировки запроса и способа получения оценок.
Разбор
Авторы не пытались проверить, угадала ли модель будущий курс. Они задавали ей наборы вопросов о связанных событиях и смотрели, совместимы ли выданные вероятности друг с другом. Затем линейная оптимизация — перебор ставок с помощью математического алгоритма — искала стратегию, которая гарантировала бы прибыль тому, кто ставит против этих оценок. Если такая стратегия находилась, это считали признаком несогласованности. Идея опирается на теорему де Финетти: набор вероятностей должен позволять принимать ставки без гарантированного проигрыша одной из сторон.
Можно ли доверять
Это препринт с arXiv, поэтому работу ещё не проверили независимые рецензенты. Кроме того, эксперименты в основном проводили на прогнозах нормированных доходностей акций и подробно проверяли один открытый модельный вариант GPT-OSS-120B; пока неизвестно, сохранится ли тот же порядок результатов в других темах, моделях и при другой формулировке запроса.
Пересказано ИИ по научной статье. Как это устроено