Препринт — материал ещё не прошёл рецензирование
Tiny Aya рассуждает на языке запроса более чем в 93% случаев
Кратко
Авторы обучили модель на широком наборе языков и достаточном объёме примеров рассуждений на английском. В шести стандартизированных тестах по математике, здравому смыслу, следованию инструкциям и другим задачам она рассуждала на языке запроса более чем в 93% случаев на 60 языках, хотя точность заметно различалась между языками и задачами.
Зачем это знать
Результат намекает, что для многоязычного ИИ не обязательно отдельно обучать рассуждения на каждом языке: широкое смешивание данных может перенести эту способность между языками. Пока это следует из тестов, а не из реального использования, и сам язык рассуждения не гарантирует правильный ответ.
Разбор
Авторы пошли не от идеи «добавить рассуждения на каждом языке», а от состава обучающих данных. На этапе дообучения модели они смешивали два типа примеров: готовые многоязычные тексты без пошаговых решений и английские примеры с такими решениями. Затем проверяли, помогает ли широкое покрытие языков переносить сам способ рассуждать на языки, которых модель отдельно этому не учила.
Это важно потому, что хорошие пошаговые примеры особенно легко получить для английского и для задач с однозначной проверкой, например математики. Но авторы хотели проверить перенос и на менее формальные случаи: открытые ответы, здравый смысл и вопросы, связанные с культурным контекстом. В тестах Tiny Aya L2-Thinker сохраняла сильные результаты по содержанию ответа, а не только начинала писать рассуждения на нужном языке.
Отдельный результат — перенос работал и на языки, оставленные вне целевого обучения. Авторы связывают это с тремя условиями: в данных должно быть много разных языков, многоязычные тексты не обязаны содержать разметку рассуждений, но английская база таких примеров должна быть достаточно сильной. Модель и набор многоязычных данных авторы открыли для дальнейших проверок.
Ключевые цифры
Можно ли доверять
Это препринт arXiv, поэтому независимая проверка рецензентами ещё впереди. Модель проверили на шести тестах, включая открытые и культурно связанные задачи, но это всё равно стендовые оценки, а не наблюдение за использованием людьми в реальных диалогах; кроме того, результаты заметно меняются от языка к языку.
Пересказано ИИ по научной статье. Как это устроено