Препринт — материал ещё не прошёл рецензирование
ИИ часто додумывает недостающие факты в юридических вопросах
Кратко
Авторы проверили 10 языковых моделей на 202 заданиях из шести областей права и 24 юрисдикций США. Ни одна модель не превысила F2 = 0,46, а медианная полнота обнаружения важных пропусков составила 0,44. При этом системы нередко отвечали, молча предполагая недостающие обстоятельства.
Зачем это знать
Этот препринт указывает на слабое место ИИ-помощников для права: содержательный ответ ещё не означает, что система заметила нехватку данных. Вывод относится к ограниченной проверке, а не к реальным консультациям и другим странам.
Разбор
Авторы не просто дали моделям юридические вопросы и проверили правильность ответов. Они взяли 58 обычных вопросов, а затем сделали из них 144 версии с намеренно убранными важными обстоятельствами — например, теми, от которых зависит применимое правило или сам исход дела. Практикующие юристы заранее отметили, какой информации не хватает. Так авторы проверяли три шага: заметила ли модель пробел, назвала ли именно недостающий факт и удержалась ли от поспешного вывода.
Для описания ошибок исследователи выделили восемь типов пропусков. Они также разделили ситуации по роли недостающего факта: он может переключить применимое правило, открыть или закрыть путь к определённому выводу либо быть обязательным предварительным условием. Это важное отличие от обычных тестов: там вопрос считают полностью заданным, хотя в реальной переписке пользователь часто сообщает лишь часть обстоятельств.
Модели запускали с одной и той же короткой инструкцией — фактически просили просто ответить как юридического помощника. Главная проблема оказалась не только в неверном распознавании пропусков, но и в молчании: система могла дать содержательный ответ, ни словом не предупредив, что опирается на выдуманное или негласно принятое предположение. При этом ни одна модель не смогла одновременно хорошо распознавать неполные вопросы, оговаривать ограничения и прямо отвечать на вопросы, где данных достаточно.
Результат не объясняется только строгостью одной проверяющей модели: ответы дополнительно оценили ещё два независимых судьи, и общий вывод сохранился. Впрочем, это всё равно контролируемый тест, а не наблюдение за реальными юридическими диалогами.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не проверили рецензенты журнала. Сильная сторона работы — разметка практикующими юристами и повторная проверка ответов двумя другими судьями, но тест всё равно имитирует вопросы, а не показывает поведение моделей в настоящих консультациях.
Пересказано ИИ по научной статье. Как это устроено