Препринт — материал ещё не прошёл рецензирование
Модель для бангла неплохо сверяет письменные ответы с оценками учителей
Кратко
Авторы дообучили лёгкую модель Qwen3-8B для проверки письменных ответов на бангла и английском. В отчёте она лучше других совпадала с оценками учителей в небольшом человеческом тесте и давала более устойчивую к утечке подсказок обратную связь в синтетической проверке.
Зачем это знать
Это показывает, что автоматическая проверка ответов для низкоресурсных языков может работать с открытой моделью, но пока вывод держится на препринте, синтетических данных и небольшом наборе размеченных учителем ответов. Для практики это скорее направление для дальнейшей проверки, чем готовый совет для школ.
Разбор
Авторы взяли лёгкую открытую модель и дообучили её так, чтобы она не просто искала совпадения слов, а сверялась со смыслом ответа. Для этого в системе сразу подают три вещи: сам вопрос, эталонный ответ и ответ ученика. Такая схема важна, потому что правильный ответ на бангла или английском может звучать совсем по‑разному, и обычная проверка по ключевым словам тут легко ошибается.
Чтобы обучение было под контролем, они собрали синтетический двуязычный набор данных — то есть специально сгенерированные примеры на бангла и английском, где известно, как должна выглядеть оценка. Это позволило проверить модель в одинаковых условиях и сравнить её с другими открытыми и закрытыми системами. На таком тесте дообученная версия Qwen3-8B показала самое сильное совпадение с оценками людей и самые устойчивые к утечке подсказок пояснения: она меньше подсказывала ответу то, чего в самом ответе не было.
Потом авторы отдельно проверили, насколько результат похож на мнение учителя, уже на человеческой разметке. Там улучшение тоже сохранилось: дообученная модель ближе всего сошлась с оценками преподавателей среди сравниваемых вариантов. Ещё один важный момент — модель получилась достаточно компактной, чтобы её можно было запускать на одной видеокарте, то есть идея не ограничивается тяжёлыми серверными системами.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, то есть работу ещё не прошло полноценное рецензирование. Авторы опираются и на синтетические данные, и на отдельный небольшой человеческий тест на 259 примерах, поэтому выводы выглядят убедительно, но пока это скорее сильное направление, чем окончательный стандарт для школ.
Пересказано ИИ по научной статье. Как это устроено