Препринт — материал ещё не прошёл рецензирование
ИИ неплохо оценивает вероятность правильности ответа, но уверенно ошибается
Кратко
На 99 вопросах из TriviaQA две группы языковых моделей довольно точно отличали правильные ответы от неправильных по собственной числовой уверенности: показатель достиг 0,937–0,956. При переформулировке запроса оценки заметно менялись, а несколько одинаковых ответов иногда лишь усиливали общую ошибку.
Зачем это знать
Уверенность ИИ может быть полезным сигналом, но сама по себе не подтверждает истинность ответа: она зависит от формулировки запроса и способна уверенно воспроизводить одну и ту же ошибку.
Разбор
Авторы сравнили три способа понять, можно ли верить ответу модели: попросили её самой назвать уверенность, отдельно спросили, считает ли она ответ истинным, и посмотрели, совпадут ли ещё три независимые генерации. Это важно, потому что одинаковые ответы на первый взгляд выглядят как подтверждение, но все попытки модели могут опираться на одну и ту же ошибочную догадку.
Перед подсчётами исследователи вручную проверили эталонные ответы TriviaQA — набора вопросов на общие знания. Оказалось, что автоматическая проверка сама ошибалась: например, не узнавала сокращённый или расширенный вариант правильного имени, а в одном вопросе эталон содержал неверное число. После исправления таких случаев оценка точности выросла на 4 процентных пункта для одной модели и на 3 — для другой. Это показывает, что качество проверки ответов напрямую влияет на выводы об «уверенности» ИИ.
Совпадение трёх дополнительных ответов оказалось заметно слабее, чем словесная оценка уверенности, а простое объединение сигналов не дало устойчивого выигрыша для обеих моделей. При этом одинаковый уже готовый ответ получал разную оценку уверенности в зависимости от почти равной формулировки запроса. В отдельной проверке биографических утверждений разница между подтверждёнными и опровергнутыми фактами была лишь небольшой. Поэтому авторы предлагают использовать уверенность как повод включить внешнюю проверку, а не как доказательство истинности.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Авторы анализировали ответы моделей на наборе вопросов и отдельные текстовые утверждения, а не работу системы на реальных пользователях; кроме того, часть выводов зависит от ручной проверки эталонных ответов. Результат полезен как аккуратный тест методов, но для применения в качестве контроля фактов нужны более крупные исследования с независимой проверкой правильности.
Пересказано ИИ по научной статье. Как это устроено