Препринт — материал ещё не прошёл рецензирование
Перевод модели на 4 бита усиливает ошибки при поиске перезаписанных значений
Кратко
Авторы проверили три модели ИИ на задаче, где нужно найти значение после нескольких его замен в длинном тексте. При переводе модели на 4 бита точность Qwen2.5-7B при большом количестве отвлекающей информации упала с 81,0% до 68,3%; переход на 8 бит тоже ухудшил результат у двух из трёх моделей.
Зачем это знать
Экономия памяти при уменьшении размера модели может иметь скрытую цену при работе с длинными текстами, в которых значения постоянно меняются. Но это препринт, а вывод относится к специальной задаче, а не ко всем обычным сценариям использования ИИ.
Разбор
Авторы оставили саму задачу неизменной и сравнили три варианта точности вычислений: обычный FP16, 8-битный INT8 и 4-битный INT4/NF4. Их прогнали на трёх разных по устройству инструкционных моделях — Qwen, Mistral и Phi. В тексте сначала несколько раз меняли одно и то же значение, а затем просили модель назвать последнее; одновременно увеличивали число похожих отвлекающих значений. Такой дизайн позволил отделить влияние сжатия модели от влияния самой сложности задания.
Проблема проявилась не везде одинаково. У Qwen точность держалась не ниже 96% вплоть до 32 отвлекающих замен, а затем при 64 заменах резко провалилась. Поэтому средняя потеря по всему диапазону у этой модели выглядит небольшой — 1,8%, хотя на самом сложном уровне падение заметное. У Mistral и Phi ухудшение начиналось раньше и шло постепенно, так что их средние показатели лучше отражали общую кривую ошибок.
Авторы также проверили, что именно ломается. Эффект возникал главным образом с отвлекающими словами похожего типа; в отдельной числовой проверке направление изменения даже менялось. При INT4 модель чаще выдавала старое значение для того же ключа — то есть путала текущую запись с одной из прежних. Дополнительный эксперимент показал: источник проблемы находится в основном внутри сжатой основной части трансформера, а не в последнем слое, который превращает внутреннее представление в ответ.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, поэтому его ещё не прошла независимая журнальная рецензия. Авторы проверили три модели и несколько режимов точности на сотнях и более парных испытаний, но речь идёт о специальном искусственном тесте, а не о реальных пользовательских диалогах или широком наборе приложений.
Пересказано ИИ по научной статье. Как это устроено