dumai
🤖
ИИПрепринтarXiv cs.LG

Препринт — материал ещё не прошёл рецензирование

В диффузионных моделях ухудшение обобщения начинается до запоминания данных

0

Кратко

В препринте авторы изучили модели, которые создают изображения из зашумлённых примеров, и обнаружили: ухудшение работы начинается, когда число параметров примерно сравнивается с числом обучающих примеров, задолго до полной подгонки данных. Штраф за сложность модели и прекращение обучения раньше помогли большим моделям превзойти модели без регуляризации. Вывод основан на небольшом наборе серых изображений и упрощённой теоретической модели.

Зачем это знать

Результат показывает, что для диффузионных моделей больший размер сам по себе не гарантирует лучшего обобщения: важны и способы сдерживать переобучение. Пока это вывод для конкретных настроек препринта, а не универсальное правило для всех диффузионных моделей.

Разбор

Авторы посмотрели на проблему с двух сторон. Сначала они обучали обычные U-Net — популярный тип нейросети для диффузионных моделей — предсказывать шум на чёрно-белых изображениях CelebA. Для каждого исходного изображения использовали несколько заранее зафиксированных вариантов шума, поэтому модель видела не просто набор картинок, а много пар «изображение плюс шум». Затем тот же вопрос проверили на упрощённой модели со случайными признаками: в ней первый слой случайно задают и больше не меняют, а обучают только второй. Такая конструкция позволяет получить формулы для кривых обучения и понять, откуда берётся ошибка.

Ключевая деталь — в диффузионном обучении у одного изображения бывает много шумовых вариантов. Поэтому точная подгонка всех обучающих примеров наступает намного позже, чем первые признаки ухудшения на новых данных. Авторы связывают это не с тем, что модель просто слишком «шумная», а с изменением того, что именно она оценивает: вместо общей закономерности начинает всё точнее воспроизводить особенности конечного набора изображений. Разбор ошибки на две части показал, что сначала растёт систематическая ошибка — модель всё хуже приближает закономерность, характерную для новых данных; после пика случайная составляющая уменьшается, но систематическая остаётся большой.

Это объясняет, почему увеличение числа вариантов шума не спасает от раннего ухудшения: оно отодвигает момент полной подгонки, но не начало роста ошибки. Практически авторы проверяли два способа не дать модели уйти в этот режим: штрафовали слишком большие веса в упрощённой модели и останавливали обучение U-Net раньше. В обоих случаях крупные модели использовали свою вместимость с пользой, тогда как без такого контроля увеличение размера не гарантировало лучшего результата.

Ключевые цифры

512–8192 изображенийМодели проверили на наборах разного размера, но даже самый большой набор остаётся небольшим по меркам современных генеративных систем.
29 тыс. – 240 млн параметровДиапазон размеров моделей огромен: сравнивали компактные сети с системами, у которых в тысячи раз больше настраиваемых чисел.
1000 шагов диффузииПроцесс добавления и удаления шума разбили на тысячу уровней, поэтому сеть училась работать с разной степенью зашумления.
2 млн шагов обученияКаждую модель обучали очень долго — этого достаточно, чтобы заметить не только итоговую подгонку, но и постепенное ухудшение по ходу обучения.

Можно ли доверять

Это препринт на arXiv, поэтому его ещё не проверили независимые рецензенты. Авторы сочетали эксперименты на чёрно-белых изображениях CelebA с упрощённой теорией, так что механизм выглядит убедительно, но переносить выводы на большие цветные датасеты и реальные промышленные модели пока рано.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.LG)
Дата публикации у нас23 сентября 2026 г.
Дата источника22 сентября 2026 г.
ОригиналОткрыть
АвторыRaphaël Urfin, Tony Bonnaire, Giulio Biroli, Marc Mézard