Препринт — материал ещё не прошёл рецензирование
Local languages лучше открывают культурные знания у моделей
Кратко
Авторы проверили ответы примерно 80 моделей на культурные и некультурные вопросы в 13 регионах. Они использовали контролируемую схему с реальными вопросами и моделью item response theory, чтобы отделить общую языковую сильность от доступа к знаниям.
Зачем это знать
Это помогает точнее читать результаты тестов: слабый ответ на местном языке не всегда значит, что у модели нет нужных культурных знаний. Но это preprint и работа с оценкой моделей, поэтому выводы стоит воспринимать как предварительные, а не как практический совет.
Разбор
Авторы взяли реальные культурные вопросы из региональных наборов данных и местных источников, а потом задали их моделям в двух вариантах: на английском и на местном языке. Смысл был не просто посмотреть, где ответов больше, а понять, что именно влияет на результат — общая сила модели в языке или доступ к культурным знаниям, которые могут «всплывать» по-разному в зависимости от языка запроса.
Чтобы не смешивать эти две вещи, они использовали схему с двумя типами вопросов: нейтральные по культуре и завязанные на местный контекст. Затем применили модель, которая оценивает сложность вопросов и способности моделей на одной шкале, чтобы сравнивать ответы честнее, а не по сырой точности. Это важно, потому что модель может выглядеть слабее на местном языке просто из-за языка, а не из-за того, что она не знает сам культурный факт.
Самое интересное — после поправки на языковую сильность почти во всех сочетаниях региона и модели местный язык давал преимущество именно в доступе к культурным знаниям. При этом на нейтральных вопросах английский чаще оказывался сильнее, что показывает разницу в языковой подготовке. Иными словами, слабый результат на локальном языке не обязательно означает слабые знания: иногда знания есть, но они хуже «достаются» из-за недостаточной языковой компетенции.
Ключевые цифры
Можно ли доверять
Это preprint на arXiv, то есть статью ещё не прошли внешнюю рецензию. С другой стороны, здесь не одна маленькая проба, а широкое сравнение примерно 80 моделей в 13 регионах, поэтому картина выглядит убедительно. Но пока это всё же исследование оценки моделей, а не проверка в реальном продукте, так что результаты лучше считать сильным ориентиром, а не окончательным правилом.
Пересказано ИИ по научной статье. Как это устроено