dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Новые методы правки знаний не переносят выводы на связанные факты

0

Кратко

Авторы предложили бенчмарк для проверки того, как методы правки знаний в LLM справляются не только с прямым фактом, но и с его логическими следствиями. На тестах с ROME и FT модели часто обновляли сам факт, но хуже отвечали на вопросы про связанные выводы.

Зачем это знать

Работа показывает, что оценивать такие методы только по прямой правке недостаточно: модель может знать исправленный факт, но не использовать его там, где нужны логические следствия. Это важно для более точной оценки систем, которые обновляют знания в больших языковых моделях.

Разбор

Авторы не просто проверили, может ли языковая модель выучить новый факт. Они собрали отдельную схему проверки, где из базы знаний вытащили связанные правила и на их основе сделали вопросы с несколькими шагами рассуждения. Идея была простая: если в модели поправили один факт, то она должна вести себя согласованно и в близких логических выводах, а не только в прямом ответе.

Для этого они взяли существующие наборы тестов, извлекли из вопросов сущности, собрали вокруг них граф знаний из DBpedia — это большая база связей между объектами и событиями — и затем нашли в этих связях логические правила с помощью системы AMIE3. После этого на основе этих правил сгенерировали новые вопросы: не про сам исправленный факт, а про то, что из него следует. Так они смогли сравнить два сценария: когда модель просто повторяет обновлённую информацию и когда ей нужно применить её в рассуждении.

Главный результат оказался неприятным для методов правки знаний: они часто действительно встраивают в модель сам исправленный факт, но заметно хуже справляются с выводами, которые из него должны вытекать. В экспериментах с ROME и FT разрыв между оценкой на прямом факте и на связанных знаниях доходил до 24%. То есть модель как будто «знает ответ», но не умеет использовать это знание в похожих логических задачах.

Отсюда и вывод статьи: если проверять такие методы только по прямому вопросу, можно переоценить их качество. Для правки знаний нужна проверка не только памяти, но и того, как обновление влияет на смысловые связи между фактами.

Ключевые цифры

24%Разница между тем, как хорошо модель отвечает на прямой исправленный факт и на связанные с ним выводы, может быть очень большой.

Можно ли доверять

Это препринт на arXiv, то есть статью ещё не проверяли независимые рецензенты. Зато авторы не ограничились одной игрушечной задачей: они построили отдельный бенчмарк и сравнили несколько популярных методов правки знаний, так что картина выглядит содержательно. Но пока это лабораторная проверка на сгенерированных вопросах, поэтому в реальных приложениях разрыв может быть другим.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас10 июня 2026 г.
Дата источника9 июня 2026 г.
ОригиналОткрыть
АвторыTatiana Moteu Ngoli, NDah Jean Kouagou, Hamada M. Zahera, Axel-Cyrille Ngonga Ngomo