dumai
🤖
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

ИИ неплохо оценивает вероятность правильности ответа, но уверенно ошибается

0

Кратко

На 99 вопросах из TriviaQA две группы языковых моделей довольно точно отличали правильные ответы от неправильных по собственной числовой уверенности: показатель достиг 0,937–0,956. При переформулировке запроса оценки заметно менялись, а несколько одинаковых ответов иногда лишь усиливали общую ошибку.

Зачем это знать

Уверенность ИИ может быть полезным сигналом, но сама по себе не подтверждает истинность ответа: она зависит от формулировки запроса и способна уверенно воспроизводить одну и ту же ошибку.

Разбор

Авторы сравнили три способа понять, можно ли верить ответу модели: попросили её самой назвать уверенность, отдельно спросили, считает ли она ответ истинным, и посмотрели, совпадут ли ещё три независимые генерации. Это важно, потому что одинаковые ответы на первый взгляд выглядят как подтверждение, но все попытки модели могут опираться на одну и ту же ошибочную догадку.

Перед подсчётами исследователи вручную проверили эталонные ответы TriviaQA — набора вопросов на общие знания. Оказалось, что автоматическая проверка сама ошибалась: например, не узнавала сокращённый или расширенный вариант правильного имени, а в одном вопросе эталон содержал неверное число. После исправления таких случаев оценка точности выросла на 4 процентных пункта для одной модели и на 3 — для другой. Это показывает, что качество проверки ответов напрямую влияет на выводы об «уверенности» ИИ.

Совпадение трёх дополнительных ответов оказалось заметно слабее, чем словесная оценка уверенности, а простое объединение сигналов не дало устойчивого выигрыша для обеих моделей. При этом одинаковый уже готовый ответ получал разную оценку уверенности в зависимости от почти равной формулировки запроса. В отдельной проверке биографических утверждений разница между подтверждёнными и опровергнутыми фактами была лишь небольшой. Поэтому авторы предлагают использовать уверенность как повод включить внешнюю проверку, а не как доказательство истинности.

Ключевые цифры

0,765–0,790Когда три дополнительных ответа совпадали, это лишь умеренно помогало отличать правду от ошибки — согласие модели не стало надёжной проверкой.
4–9%Изменение почти одинаковой формулировки запроса меняло итоговое решение о доверии к ответу примерно в каждом двадцатом–одиннадцатом случае.
0,8При таком пороге модель считали достаточно уверенной; именно на этом уровне небольшая смена запроса иногда переворачивала решение.
100В отдельной проверке изучили сто биографических утверждений с отметкой уверенности, но даже там уверенность лишь немного различала подтверждённые и опровергнутые факты.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не проверили независимые рецензенты. Авторы анализировали ответы моделей на наборе вопросов и отдельные текстовые утверждения, а не работу системы на реальных пользователях; кроме того, часть выводов зависит от ручной проверки эталонных ответов. Результат полезен как аккуратный тест методов, но для применения в качестве контроля фактов нужны более крупные исследования с независимой проверкой правильности.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас19 сентября 2026 г.
Дата источника17 сентября 2026 г.
ОригиналОткрыть
АвторыLukas Meyer, Sofia Rossi, Wei Chen, Thomas Laurent, Yiming Li