Препринт — материал ещё не прошёл рецензирование
Из одного видео можно получить движущуюся модель человека со всех сторон
Кратко
Авторы создали способ, который берёт видео человека с одной обычной камеры и достраивает виды, будто камера обошла его со всех сторон. По их оценке, на постановочных и реальных видео он дал более качественные виды и модель, одновременно описывающую внешний вид и движение, чем прежние способы.
Зачем это знать
Такая реконструкция может пригодиться для виртуальных сцен и игр, но пока это результат препринта: преимущество показали только на выбранных авторами наборах данных, а качество в любых новых условиях съёмки не установлено.
Разбор
Проблема возникла на следующем шаге после генерации новых ракурсов. Для сборки объёмной модели нужны десятки видов, но видеомодель не может обработать их все сразу. Авторы разделяют ракурсы на группы — и из-за этого группы начинают «расходиться»: одна часть тела может выглядеть чуть иначе, чем другая, а общая форма постепенно плывёт. Кроме того, чем больше уже созданных видов подают модели в качестве подсказки, тем слабее она использует каждый из них.
Авторы решили эти две проблемы разными приёмами. Reference Context Packing сжимает накопленные виды в контекст фиксированного размера, поэтому подсказка не разрастается вместе с числом ракурсов. Target Context Routing на разных шагах генерации по-разному перегруппировывает целевые виды: сначала даёт группам обмениваться общей информацией о форме, а затем помогает им согласовать мелкие детали. После этого получившиеся многовидовые видео превращают в 4D Gaussian Splatting — представление, которое описывает объёмную сцену и её изменения во времени.
Для обучения авторы собрали MVGameHuman в собственном игровом движке и добавили видео из световой студии и обычных съёмок «из жизни». Проверка на наборах DNA-Rendering и DyMVHumans показала преимущество не только по виду с новых ракурсов, но и по качеству итоговой 4D-модели. Отдельно авторы сообщают, что метод сохраняет работоспособность на обычных видео, которые не выглядят как студийная постановка.
Ключевые цифры
Можно ли доверять
Это препринт с arXiv, а не статья, прошедшая независимую рецензию. Авторы проверили метод на нескольких наборах данных и заявили об устойчивой работе на обычных видео, но абстракт не сообщает размеры этих наборов и не показывает, как система поведёт себя в любых новых условиях съёмки.
Пересказано ИИ по научной статье. Как это устроено