Препринт — материал ещё не прошёл рецензирование
Токенизаторы сильно завышают цену индийских языков в ИИ-моделях
Кратко
Авторы сравнили, как шесть популярных токенизаторов разбивают текст на 14 индийских языках и на английском, используя набор параллельных текстов FLORES-200. В cl100k_base индийские языки в среднем требуют в 8,0 раза больше токенов, а для малаялам — до 13,0 раза, поэтому в тот же лимит контекста помещается меньше смысла. Более мультиязычные токенизаторы, включая XLM-R и o200k_base, сокращают этот разрыв примерно на 73%.
Зачем это знать
Это показывает, что часть неравенства между языками в больших языковых моделях может идти не от самих языков, а от того, как модель режет текст на куски. Для разработчиков это сигнал проверять токенизатор при работе с неанглийскими языками и выбирать более подходящие варианты.
Разбор
Авторы взяли один и тот же смысловой материал на 200+ языках и прогнали его через разные токенизаторы — это такие разметчики текста, которые режут строку на куски перед тем, как её увидит языковая модель. Так они отделили проблему языка от проблемы содержания: если смысл один и тот же, а токенов в одном языке нужно намного больше, значит дело не в теме текста, а в том, как именно токенизатор его разбирает.
Дальше они сравнили шесть популярных токенизаторов и посмотрели, где разрыв сильнее всего. Главная причина оказалась довольно приземлённой: токенизатор часто не может склеить соседние байты в более крупные знакомые куски, и текст остаётся разбитым на слишком мелкие фрагменты. Это не выглядит как “особенность индийских языков сама по себе” — наоборот, более мультиязычные токенизаторы заметно уменьшают потери, так что проблема в дизайне словаря и правилах разбиения.
Ещё важный момент: авторы показали не только статистику токенов, но и практический эффект. Если лимит контекста фиксирован, то в индийских языках в модель помещается меньше исходного текста, то есть часть смысла просто не влезает. Они также проверили связь с результатами на задаче чтения и понимания текстов, но тут картина оказалась сложнее: связь между “дороговизной” токенизации и качеством ответа в основном объясняется тем, сколько языковых ресурсов у языка вообще есть, а не токенизатором в одиночку.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть статья ещё не прошла обычную внешнюю рецензию. Но проверка выглядит основательной: авторы сравнили много языков, взяли профессионально выровненный параллельный корпус и протестировали сразу несколько токенизаторов. При этом часть выводов — про связь с пониманием текста — сами авторы называют более осторожной, так что главные результаты здесь надёжнее, чем попытка объяснить всё до последней причины.
Пересказано ИИ по научной статье. Как это устроено