dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

Языковые модели хуже справляются с Брайлем, чем с обычным английским

0

Кратко

Авторы проверили шесть языковых моделей на 5570 заданиях по математике, здравому смыслу и вопросам, где нужно сделать несколько шагов. Брайль — система письма для незрячих; модели хуже справлялись с ним, особенно когда весь запрос был записан Брайлем, а его более сложная сокращённая форма была особенно ненадёжна во входных данных.

Зачем это знать

Тест показывает, что хорошие результаты на обычном английском не гарантируют такой же работы с Брайлем. Это важно учитывать при оценке доступности ИИ, но вывод пока основан на шести моделях и искусственных заданиях, а не на опыте незрячих пользователей.

Разбор

Авторы собрали BrailleBench — набор проверок, где одну и ту же задачу показывают модели в разных видах Брайля. Они сравнивали не только понимание запроса, но и способность отвечать Брайлем и пройти весь путь от запроса до ответа. В набор вошли пять готовых тестов: от школьной математики до вопросов, где нужно связать несколько фактов. Для честности авторы сами преобразовали задания с помощью специального инструмента, а затем попросили экспертов всё проверить; тексты от языковых моделей в набор не добавляли.

Отдельно исследователи проверили, влияет ли способ записи Брайля на результат. Те же самые символы представляли как Braille ASCII — текстовую запись, которую часто используют в цифровых системах, — как Unicode-символы Брайля и как последовательности номеров точек. Разница оказалась резкой: ASCII был самым устойчивым форматом, а номера точек почти всегда приводили к нулевым результатам. Это значит, что модель может реагировать не только на сам Брайль, но и на привычный для неё способ его цифрового представления.

Проверка проходила без подсказок, примеров и справочника по расшифровке Брайля. Поэтому модели должны были сами распознать правила записи и решить задачу. Авторы также сравнивали обычный английский с вариантами, где Брайлем написана только часть запроса или весь запрос целиком: полная запись Брайлем дополнительно ухудшала результат. Важная деталь — способность понимать Брайль и способность выдавать ответ в Брайле не совпадали: модель могла лучше справляться с одной стороной задачи, чем с другой.

Ключевые цифры

3 формата записиОдни и те же клетки Брайля проверили как ASCII, Unicode и номера точек — поэтому видно влияние не только содержания, но и цифрового оформления.
89% против 0% и 0%В одной математической проверке Claude Opus 4.8 решил 89% заданий в Braille ASCII, но не решил ни одного в Unicode- и точечной записи.
63% против 0% и 0%В более сложной сокращённой записи Брайля у той же модели результат на ASCII заметно выше, чем на двух других форматах.
4 096 токеновДля самых длинных математических ответов модели разрешали выдать до 4 096 единиц текста, чтобы ограничение длины не мешало проверке.

Можно ли доверять

Это препринт с arXiv, поэтому другие учёные ещё не проверили работу независимой рецензией. Тест охватывает шесть моделей и 5 570 искусственных заданий, но модели работали без примеров и справочника, а опыт реальных незрячих пользователей в исследовании не проверяли; поэтому результат показывает поведение в тестовом формате, а не всю доступность ИИ в жизни.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас28 августа 2026 г.
Дата источника27 августа 2026 г.
ОригиналОткрыть
АвторыJinghan Zhang, Fengran Mo, Zhiyu Chen, Xiaoyan Han, Kunpeng Liu, Chang-Tien Lu