Препринт — материал ещё не прошёл рецензирование
Новый способ квантизации снижает потери точности без калибровочных данных
Кратко
Авторы предложили метрику TQS для посттренировочной квантизации временных рядов, рассматривая модель как динамическую систему. На наборе прогнозных моделей она помогала распределять разрядность без калибровочных данных и без вторых производных, а в ряде режимов сохраняла точность лучше базовых подходов.
Зачем это знать
Это может быть полезно для сжатия моделей, где нет удобных калибровочных данных или доступ к внутренностям модели ограничен. Но это пока только препринт и результаты проверяли на выбранных моделях и режимах сильного сжатия.
Разбор
Авторы посмотрели на квантизацию не как на «сжать числа и надеяться на лучшее», а как на задачу про устойчивость системы во времени. Проще говоря, они представили прогнозную модель как механизм, который делает шаг за шагом новые предсказания, и оценили, как ошибки от уменьшения разрядности разрастаются по этой траектории. Из этого они вывели метрику TQS — по ней можно заранее понять, какие части модели сильнее всего пострадают от квантизации.
Главная практическая идея здесь в том, что такую оценку можно сделать без калибровочных данных — то есть без отдельного набора примеров, на которых обычно подбирают параметры квантизации. Ещё важнее, что метод не требует вычислять вторые производные, а это обычно тяжёлая часть таких алгоритмов. Поэтому TQS-PTQ можно применять даже к «закрытым» моделям, где внутрь почти не заглянешь, включая варианты, упакованные в виде уже собранных блоков.
Дальше авторы использовали эту метрику, чтобы распределять разрядность по частям модели: где-то оставить больше точности, где-то сильнее ужать. Такой подход сравнили на трёх больших прогнозных моделях для временных рядов и погоды. По результатам TQS-PTQ особенно хорошо работает при сильном сжатии: он удерживал качество лучше или на уровне сильных базовых методов и нередко обходил их по ошибке при том же уровне сжатия. Ещё один плюс — один проход оценки можно переиспользовать для разных целей сжатия, вместо того чтобы каждый раз заново калибровать модель.
Ключевые цифры
Можно ли доверять
Это препринт на arXiv, значит, работу ещё не проверяли независимые рецензенты. Авторы тестировали метод на трёх выбранных моделях и на конкретных наборах данных, так что переносимость на другие задачи ещё нужно подтверждать. Зато проверка не ограничилась одной маленькой демонстрацией: модели крупные, а сравнение шло с несколькими сильными базовыми методами.
Пересказано ИИ по научной статье. Как это устроено