dumai
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Повседневные ошибки людей и LLM похожи на шаблонные ответы

0

Кратко

В препринте на arXiv авторы сравнили людей и 25 LLM в задачах на бытовое причинное мышление. Они увидели похожие по содержанию и контексту ошибки и связали их с шаблонным подбором ответа, а для LLM отдельно указали на роль некоторых голов внимания.

Зачем это знать

Это важно как осторожная подсказка о том, что сбои в рассуждении у моделей и людей могут иметь общие черты. Но работа пока не прошла рецензирование, а вывод о механизме у людей основан на косвенных признаках, поэтому прямых практических рекомендаций она не даёт.

Разбор

Авторы взяли не одну узкую задачу, а набор бытовых ситуаций, где нужно понять простую причину и следствие: что на что влияет, что произойдёт после действия, где ошибка в формулировке меняет ответ. Потом они сравнили, как на такие вопросы отвечают люди и 25 больших языковых моделей. Идея была проверить не просто, ошибаются ли модели, а похожи ли сами ошибки на человеческие — по смыслу и по тому, как они зависят от деталей задания.

Самый любопытный результат в том, что ошибки у людей и у моделей оказались похожи не только по факту, но и по форме. Небольшие, вроде бы неважные изменения в тексте — например, замена одного направления на другое или одного предмета на другой — меняли ответы и у людей, и у LLM. Это намекает, что оба типа системы опираются не на абстрактное «внутреннее правило», а на более шаблонные связи между словами, контекстом и ожидаемым продолжением ответа.

Для моделей авторы пошли дальше и посмотрели, какие именно части архитектуры подталкивают их к таким ответам. Они выделили набор голов внимания — это элементы механизма, который помогает модели решать, на какие слова в запросе смотреть сильнее других. Эти головы оказались связаны с шаблонным подбором ответа, и по ним можно было предсказывать даже те ошибки людей, которые кажутся случайными: если в подсказке есть лишняя деталь, она может незаметно сдвинуть выбор ответа.

На фоне прошлых работ здесь важен именно сравнительный поворот. Обычно странные ошибки LLM трактуют как признак того, что у них нет настоящего рассуждения, а у людей оно якобы есть. Авторы показывают, что в бытовом причинном мышлении это различие уже не так очевидно: похожие сбои есть и у людей, и у моделей. Поэтому вопрос становится тоньше — не «умеет ли система думать вообще», а «насколько её выводы зависят от знакомых шаблонов и привычного контекста».

Можно ли доверять

Это препринт на arXiv, то есть работу ещё не проверяли рецензенты. При этом сравнение включает и людей, и 25 моделей, а сами выводы опираются на повторяющийся рисунок ошибок, так что идея выглядит небезосновательной. Но одна из самых сильных частей — объяснение механизма у людей — держится на косвенных признаках, поэтому относиться к нему лучше как к рабочей гипотезе, а не как к окончательному ответу.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас12 июня 2026 г.
Дата источника11 июня 2026 г.
ОригиналОткрыть
АвторыZach Studdiford, Gary Lupyan