dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Local languages лучше открывают культурные знания у моделей

0

Кратко

Авторы проверили ответы примерно 80 моделей на культурные и некультурные вопросы в 13 регионах. Они использовали контролируемую схему с реальными вопросами и моделью item response theory, чтобы отделить общую языковую сильность от доступа к знаниям.

Зачем это знать

Это помогает точнее читать результаты тестов: слабый ответ на местном языке не всегда значит, что у модели нет нужных культурных знаний. Но это preprint и работа с оценкой моделей, поэтому выводы стоит воспринимать как предварительные, а не как практический совет.

Разбор

Авторы взяли реальные культурные вопросы из региональных наборов данных и местных источников, а потом задали их моделям в двух вариантах: на английском и на местном языке. Смысл был не просто посмотреть, где ответов больше, а понять, что именно влияет на результат — общая сила модели в языке или доступ к культурным знаниям, которые могут «всплывать» по-разному в зависимости от языка запроса.

Чтобы не смешивать эти две вещи, они использовали схему с двумя типами вопросов: нейтральные по культуре и завязанные на местный контекст. Затем применили модель, которая оценивает сложность вопросов и способности моделей на одной шкале, чтобы сравнивать ответы честнее, а не по сырой точности. Это важно, потому что модель может выглядеть слабее на местном языке просто из-за языка, а не из-за того, что она не знает сам культурный факт.

Самое интересное — после поправки на языковую сильность почти во всех сочетаниях региона и модели местный язык давал преимущество именно в доступе к культурным знаниям. При этом на нейтральных вопросах английский чаще оказывался сильнее, что показывает разницу в языковой подготовке. Иными словами, слабый результат на локальном языке не обязательно означает слабые знания: иногда знания есть, но они хуже «достаются» из-за недостаточной языковой компетенции.

Ключевые цифры

13 регионовАвторы проверили, как работает этот эффект в разных частях мира, а не в одной-двух языковых средах.
примерно 80 моделейПроверка затронула много разных языковых моделей, так что вывод не завязан на одной системе.

Можно ли доверять

Это preprint на arXiv, то есть статью ещё не прошли внешнюю рецензию. С другой стороны, здесь не одна маленькая проба, а широкое сравнение примерно 80 моделей в 13 регионах, поэтому картина выглядит убедительно. Но пока это всё же исследование оценки моделей, а не проверка в реальном продукте, так что результаты лучше считать сильным ориентиром, а не окончательным правилом.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас8 июня 2026 г.
Дата источника5 июня 2026 г.
ОригиналОткрыть
АвторыYang Zhang, Xiao Fei, Amr Mohamed, Sarah Almeida Carneiro, Mersin Konomi, Mingmeng Geng, Ahmed Asaad, Guokan Shang, Michalis Vazirgiannis