dumai
ИИПрепринтarXiv cs.CL

Препринт — материал ещё не прошёл рецензирование

Перевод модели на 4 бита усиливает ошибки при поиске перезаписанных значений

0

Кратко

Авторы проверили три модели ИИ на задаче, где нужно найти значение после нескольких его замен в длинном тексте. При переводе модели на 4 бита точность Qwen2.5-7B при большом количестве отвлекающей информации упала с 81,0% до 68,3%; переход на 8 бит тоже ухудшил результат у двух из трёх моделей.

Зачем это знать

Экономия памяти при уменьшении размера модели может иметь скрытую цену при работе с длинными текстами, в которых значения постоянно меняются. Но это препринт, а вывод относится к специальной задаче, а не ко всем обычным сценариям использования ИИ.

Разбор

Авторы оставили саму задачу неизменной и сравнили три варианта точности вычислений: обычный FP16, 8-битный INT8 и 4-битный INT4/NF4. Их прогнали на трёх разных по устройству инструкционных моделях — Qwen, Mistral и Phi. В тексте сначала несколько раз меняли одно и то же значение, а затем просили модель назвать последнее; одновременно увеличивали число похожих отвлекающих значений. Такой дизайн позволил отделить влияние сжатия модели от влияния самой сложности задания.

Проблема проявилась не везде одинаково. У Qwen точность держалась не ниже 96% вплоть до 32 отвлекающих замен, а затем при 64 заменах резко провалилась. Поэтому средняя потеря по всему диапазону у этой модели выглядит небольшой — 1,8%, хотя на самом сложном уровне падение заметное. У Mistral и Phi ухудшение начиналось раньше и шло постепенно, так что их средние показатели лучше отражали общую кривую ошибок.

Авторы также проверили, что именно ломается. Эффект возникал главным образом с отвлекающими словами похожего типа; в отдельной числовой проверке направление изменения даже менялось. При INT4 модель чаще выдавала старое значение для того же ключа — то есть путала текущую запись с одной из прежних. Дополнительный эксперимент показал: источник проблемы находится в основном внутри сжатой основной части трансформера, а не в последнем слое, который превращает внутреннее представление в ответ.

Ключевые цифры

3 моделиРезультат проверили не на одном семействе ИИ, а на трёх моделях с разной архитектурой.
64 заменыИменно на таком уровне сильного вмешательства у Qwen проявился резкий провал, которого почти не было при меньшей нагрузке.
21,5% → 24,6%После 4-битного сжатия доля попыток с возвратом старого значения выросла примерно на три процентных пункта.
300–1 200 парных испытанийВ проверке вклада последнего слоя сравнивали сотни одинаковых заданий до и после дополнительного сжатия.

Можно ли доверять

Это препринт с arXiv, поэтому его ещё не прошла независимая журнальная рецензия. Авторы проверили три модели и несколько режимов точности на сотнях и более парных испытаний, но речь идёт о специальном искусственном тесте, а не о реальных пользовательских диалогах или широком наборе приложений.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.CL)
Дата публикации у нас20 августа 2026 г.
Дата источника19 августа 2026 г.
ОригиналОткрыть
АвторыShayan Shahrabi-Farahani, Dara Rahmati