Препринт — материал ещё не прошёл рецензирование
Мультиязычные ИИ хуже понимают местную культуру, чем язык
Кратко
Для проверки этого вывода авторы собрали бенчмарк MSQA: 1 064 вопроса на 11 языковых группах, где задания опираются на местные знания, а не на перевод с английского. На 18 больших языковых моделях выяснилось, что культурные ответы заметно слабее общего владения языком, а сильнее всего с ними связано, видела ли модель местный контент при предобучении.
Зачем это знать
Это помогает отделять умение говорить на языке от реального понимания контекста страны или сообщества. Работа также показывает, что простые приёмы вроде калибровки, повторной выборки и поиска по источникам не убирают этот разрыв полностью.
Разбор
Авторы не просто сравнили модели на обычных вопросах, а собрали отдельный набор MSQA — с вопросами, которые опираются на местные знания и привычки, а не на перевод с английского. Это важно, потому что переводные тесты часто дают моделям подсказки: если идея уже встречалась в английских данных, модель может просто “перекинуть” ответ на другой язык. Здесь же проверяли именно то, что обычно ускользает при таком обходном пути.
Дальше они прогнали через этот набор 18 больших языковых моделей и посмотрели на три вещи: где именно появляется провал, что с уверенностью модели в ответах и помогает ли поиск по источникам прямо во время ответа. Оказалось, что слабое место — не просто сложные вопросы, а именно культурные вопросы: знание местного контекста заметно отстаёт от общего умения рассуждать. Причём лучше всего результат предсказывает не “умность” модели в целом, а то, сколько местного контента она видела на этапе обучения.
Ещё один важный вывод: привычные способы “подстраховать” модель не убирают проблему полностью. Если модель не знает культурный факт, она всё равно часто отвечает слишком уверенно; если попросить её несколько раз отвечать заново, стабильности это не даёт; а поиск по источникам помогает неравномерно — особенно когда речь о редких, малоизвестных фактах. То есть разрыв между языком и культурой оказался не случайной ошибкой, а устойчивым эффектом.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, его ещё не прошли внешнее рецензирование. Сильная сторона работы — собственный набор вопросов и сразу 18 моделей в тесте, но оценка всё равно идёт через автоматический судья-модель, а такие проверки могут ошибаться на тонких ответах. Также авторы сами отмечают, что поиск по источникам и повторные прогоны помогают не везде, так что выводы стоит читать как убедительный сигнал, а не как финальный вердикт для всех моделей и языков.
Пересказано ИИ по научной статье. Как это устроено