dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Восемь языковых моделей нарушали связи между математическими понятиями

0

Кратко

Восемь языковых моделей проверили на математических задачах и сравнили с данными о том, как учатся люди. Модели нередко нарушали связи между базовыми и более сложными понятиями, не всегда использовали уже данную информацию, а между ними самими оказалось мало общего. Это препринт: понятия размечал компьютер, а при ручной проверке 400 вопросов точность такой разметки составила 79,3%; выводы не обязательно распространяются на другие области.

Зачем это знать

Обычная точность ответов может скрывать особенности поведения моделей при решении задач. Такая проверка помогает заметить слабые места, которые не видны по одним правильным и неправильным ответам, но результаты пока относятся к математическим задачам и требуют независимой проверки.

Разбор

Авторы смотрели не только на то, правильно ли модель решила задачу, а на порядок, в котором у неё связаны математические знания. Для этого они использовали теорию пространств знаний — способ описывать обучение через зависимости: например, более сложное умение обычно опирается на несколько базовых. Затем сравнили ответы моделей с записями реальных школьников и проверили, сохраняются ли такие зависимости у моделей.

Материал взяли из журнала решения математических задач: в нём есть сами условия, правильность ответов и сведения о том, какие понятия проверяет каждый вопрос. Из анализа убрали задания с картинками и повторы, чтобы оценивать именно работу с текстом. Моделям давали задачи в разных режимах: иногда без подсказок о связанных понятиях, а иногда добавляли такой контекст и смотрели, станет ли ответ на зависимый вопрос лучше.

Главная деталь результата — добавленная информация не всегда помогала. Модель могла справиться с более сложным вопросом, но ошибиться в связанном с ним базовом понятии, или не использовать уже приведённую подсказку. Кроме того, ответы разных моделей складывались в разные «карты знаний»: общего устойчивого порядка понятий между ними почти не было. Обычная проверка точности и оценка ответа другой языковой моделью этого не показывали, потому что они смотрят прежде всего на итоговый ответ, а не на согласованность знаний между задачами.

Можно ли доверять

Это препринт с arXiv, поэтому выводы ещё не прошли независимую проверку рецензентами. Сильная сторона работы — сравнение с реальными журналами решений учащихся, а не только с искусственными тестами; при этом эксперимент ограничен математическими заданиями, а часть понятий размечала сама модель, что может влиять на результат.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас7 сентября 2026 г.
Дата источника4 сентября 2026 г.
ОригиналОткрыть
АвторыPeng Cui, Heejin Do, Mrinmaya Sachan