Препринт — материал ещё не прошёл рецензирование
Языковые модели хуже справляются с Брайлем, чем с обычным английским
Кратко
Авторы проверили шесть языковых моделей на 5570 заданиях по математике, здравому смыслу и вопросам, где нужно сделать несколько шагов. Брайль — система письма для незрячих; модели хуже справлялись с ним, особенно когда весь запрос был записан Брайлем, а его более сложная сокращённая форма была особенно ненадёжна во входных данных.
Зачем это знать
Тест показывает, что хорошие результаты на обычном английском не гарантируют такой же работы с Брайлем. Это важно учитывать при оценке доступности ИИ, но вывод пока основан на шести моделях и искусственных заданиях, а не на опыте незрячих пользователей.
Разбор
Авторы собрали BrailleBench — набор проверок, где одну и ту же задачу показывают модели в разных видах Брайля. Они сравнивали не только понимание запроса, но и способность отвечать Брайлем и пройти весь путь от запроса до ответа. В набор вошли пять готовых тестов: от школьной математики до вопросов, где нужно связать несколько фактов. Для честности авторы сами преобразовали задания с помощью специального инструмента, а затем попросили экспертов всё проверить; тексты от языковых моделей в набор не добавляли.
Отдельно исследователи проверили, влияет ли способ записи Брайля на результат. Те же самые символы представляли как Braille ASCII — текстовую запись, которую часто используют в цифровых системах, — как Unicode-символы Брайля и как последовательности номеров точек. Разница оказалась резкой: ASCII был самым устойчивым форматом, а номера точек почти всегда приводили к нулевым результатам. Это значит, что модель может реагировать не только на сам Брайль, но и на привычный для неё способ его цифрового представления.
Проверка проходила без подсказок, примеров и справочника по расшифровке Брайля. Поэтому модели должны были сами распознать правила записи и решить задачу. Авторы также сравнивали обычный английский с вариантами, где Брайлем написана только часть запроса или весь запрос целиком: полная запись Брайлем дополнительно ухудшала результат. Важная деталь — способность понимать Брайль и способность выдавать ответ в Брайле не совпадали: модель могла лучше справляться с одной стороной задачи, чем с другой.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому другие учёные ещё не проверили работу независимой рецензией. Тест охватывает шесть моделей и 5 570 искусственных заданий, но модели работали без примеров и справочника, а опыт реальных незрячих пользователей в исследовании не проверяли; поэтому результат показывает поведение в тестовом формате, а не всю доступность ИИ в жизни.
Пересказано ИИ по научной статье. Как это устроено