Препринт — материал ещё не прошёл рецензирование
В тесте на 60 индийских делах юридические ИИ часто уверенно ошибались
Кратко
Три ИИ-системы проверили на 60 индийских судебных делах: Meta AI ошиблась с высокой уверенностью в 31,7% случаев, Perplexity — в 15,0%, ChatGPT — в 6,7%. Особенно трудно моделям было учитывать обновлённые нормы. Среди 380 студентов те, кто встречал вымышленные ссылки — несуществующие источники, — чаще проверяли ответы, а 71,1% не проходили формального обучения этике работы с ИИ.
Зачем это знать
Уверенный тон системы не означает, что её юридический вывод верен — это создаёт риск для профессиональной работы. Но результаты основаны на небольшой проверке и поперечном опросе: они не описывают работу ИИ во всех юридических задачах и не доказывают, что именно вымышленные ссылки заставляют студентов чаще проверять ответы.
Разбор
Авторы разделили работу на две части. Сначала они дали трём системам 60 задач по индийскому договорному праву и попросили вынести решения, а затем отдельно попросили оценить уверенность каждого ответа по шкале от 1 до 10. Так они считали не любую ошибку, а именно опасную: неправильный вывод с оценкой уверенности не ниже 9. Такой показатель авторы назвали HCER — долей ошибок, которые звучат почти как бесспорный ответ.
Главная трудность возникла там, где старые судебные подходы столкнулись с обновлёнными законами. Модели хорошо держались за знакомые исторические правила, но часто переносили их на ситуации, где уже действовали новые нормы, включая изменения 2018 года в законе о конкретном исполнении договоров. У Meta AI такие ошибки сопровождались средней уверенностью 9,1 из 10 — то есть проблема была не только в неверном результате, но и в том, что система почти не показывала сомнений.
Во второй части авторы опросили студентов-юристов и сравнили их привычки проверки ответов. Те, кто раньше сталкивался с вымышленными судебными ссылками, сообщали о более частой проверке источников. Это похоже не на заранее выстроенную защиту, а на реакцию после неприятного опыта: студенты начинали проверять ответы активнее уже после того, как система их подвела. Поэтому авторы предлагают учить будущих юристов специально искать слабые места в ответах ИИ и связывать ответы моделей с проверяемыми источниками, а не просто принимать уверенную формулировку на веру.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому независимая научная проверка ещё не завершена. Выводы о моделях основаны всего на 60 юридических задачах, а выводы о студентах — на одном поперечном опросе и их самоотчётах; результаты показывают риск, но не описывают работу ИИ во всей юридической практике.
Пересказано ИИ по научной статье. Как это устроено