Препринт — материал ещё не прошёл рецензирование
Оценщики ИИ по-разному ставят оценки одному и тому же тексту на разных языках
Кратко
В работе проверили мультиязычные оценщики на одинаковых по смыслу парах «инструкция — ответ» на 23 языках. Оценки заметно расходились: при точности сравнения пар выше 90% разница в доле пропуска по одному общему порогу доходила до 43%, а языки с меньшими ресурсами чаще получали более щедрые баллы. Простая поправка порога по языку сократила этот разрыв в среднем на 60,9%, но не убрала его полностью.
Зачем это знать
Это значит, что один и тот же контент может проходить или не проходить фильтры в зависимости от языка, если системы оценки не учитывают языковые различия. Для команд, которые используют такие оценщики в безопасности или отборе ответов, это риск, который стоит проверять отдельно по языкам.
Разбор
Авторы проверили сразу несколько мультиязычных оценщиков — и обученные reward-модели, и большие языковые модели, которым просто дают роль судьи — на парах «инструкция — ответ», где смысл был одинаковым, а язык менялся. Идея была простая: если оценщик действительно одинаково понимает тексты на разных языках, то его баллы должны быть сопоставимы. Но оказалось, что это не так: один и тот же по смыслу ответ система нередко оценивала мягче или строже в зависимости от языка.
Чтобы это увидеть, они не ограничились одной моделью или одной задачей. Проверка шла на 23 языках и на восьми открытых оценщиках с разной архитектурой и разным способом обучения, а выводы потом сравнили и с более сильными закрытыми системами. Такой подход важен, потому что позволяет понять: это не случайный сбой одной конкретной модели, а более общий перекос, который повторяется в разных системах.
Самое любопытное здесь в том, что привычная проверка качества почти не замечает проблему. По парному сравнению ответов оценщики выглядели очень сильными — выше 90% точности. Но если смотреть на реальные решения по одному общему порогу, разница в доле пропуска между языками доходила до 43%. Особенно это било по языкам с меньшими ресурсами: им чаще ставили более высокие баллы, а значит, вредный контент на таких языках мог легче пройти фильтр.
Авторы также попробовали понять, откуда берётся этот сдвиг. Частично он связан с неуверенностью модели: когда она хуже «понимает» пример, то склонна ставить более высокий балл. Но этим всё не объясняется. Даже после учёта неуверенности язык сам по себе оставался важным фактором, а значит, дело не только в сложности текста, а в более глубоком языковом перекосе. Простая поправка порога по каждому языку уменьшила проблему, но не убрала её полностью.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошли полноценное рецензирование. Но она проверяет эффект сразу на 23 языках и на нескольких оценщиках, поэтому результат выглядит не как случайная аномалия, а как устойчивый перекос. При этом выводы всё равно стоит читать как сильный сигнал для проверки, а не как окончательный приговор всем мультиязычным системам.
Пересказано ИИ по научной статье. Как это устроено