dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

ИИ часто додумывает недостающие факты в юридических вопросах

0

Кратко

Авторы проверили 10 языковых моделей на 202 заданиях из шести областей права и 24 юрисдикций США. Ни одна модель не превысила F2 = 0,46, а медианная полнота обнаружения важных пропусков составила 0,44. При этом системы нередко отвечали, молча предполагая недостающие обстоятельства.

Зачем это знать

Этот препринт указывает на слабое место ИИ-помощников для права: содержательный ответ ещё не означает, что система заметила нехватку данных. Вывод относится к ограниченной проверке, а не к реальным консультациям и другим странам.

Разбор

Авторы не просто дали моделям юридические вопросы и проверили правильность ответов. Они взяли 58 обычных вопросов, а затем сделали из них 144 версии с намеренно убранными важными обстоятельствами — например, теми, от которых зависит применимое правило или сам исход дела. Практикующие юристы заранее отметили, какой информации не хватает. Так авторы проверяли три шага: заметила ли модель пробел, назвала ли именно недостающий факт и удержалась ли от поспешного вывода.

Для описания ошибок исследователи выделили восемь типов пропусков. Они также разделили ситуации по роли недостающего факта: он может переключить применимое правило, открыть или закрыть путь к определённому выводу либо быть обязательным предварительным условием. Это важное отличие от обычных тестов: там вопрос считают полностью заданным, хотя в реальной переписке пользователь часто сообщает лишь часть обстоятельств.

Модели запускали с одной и той же короткой инструкцией — фактически просили просто ответить как юридического помощника. Главная проблема оказалась не только в неверном распознавании пропусков, но и в молчании: система могла дать содержательный ответ, ни словом не предупредив, что опирается на выдуманное или негласно принятое предположение. При этом ни одна модель не смогла одновременно хорошо распознавать неполные вопросы, оговаривать ограничения и прямо отвечать на вопросы, где данных достаточно.

Результат не объясняется только строгостью одной проверяющей модели: ответы дополнительно оценили ещё два независимых судьи, и общий вывод сохранился. Впрочем, это всё равно контролируемый тест, а не наблюдение за реальными юридическими диалогами.

Ключевые цифры

8 категорийАвторы проверяли не один общий навык «замечать пробелы», а восемь разных видов юридически важной недостающей информации.
58 базовых вопросов и 144 неполных вариантаИз обычных вопросов сделали отдельные версии с пропусками, чтобы сравнить поведение системы при достаточных и недостаточных данных.
36,1%Одна из моделей прямо указала на нехватку данных лишь примерно в каждом третьем неполном вопросе.
63,9%В остальных случаях та же модель дала содержательный юридический ответ, не признав, что важная информация отсутствует.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не проверили рецензенты журнала. Сильная сторона работы — разметка практикующими юристами и повторная проверка ответов двумя другими судьями, но тест всё равно имитирует вопросы, а не показывает поведение моделей в настоящих консультациях.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас21 августа 2026 г.
Дата источника20 августа 2026 г.
ОригиналОткрыть
АвторыSamuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat