dumai
🤖
ИИПрепринтarXiv cs.AI

Препринт — материал ещё не прошёл рецензирование

На кадрах фигурного катания GenStream сократил поток данных более чем на 99,9%

0

Кратко

Система передаёт не сами кадры, а описание сцены: движения человека, положение камеры и трёхмерную модель неподвижного фона. На записи фигурного катания это сократило поток данных более чем на 99,9% по сравнению с кодеком HEVC, но потребовало значительных вычислений на устройстве зрителя.

Зачем это знать

Такой подход показывает возможный способ экономить интернет-трафик, перенося восстановление изображения на устройство зрителя. Насколько хорошо он работает за пределами фигурного катания и даёт ли преимущество по качеству, пока не ясно.

Разбор

GenStream меняет не только степень сжатия, но и саму роль плеера. Сервер отправляет компактные указания о движении, ракурсе и сцене, а устройство зрителя с помощью генеративной модели дорисовывает правдоподобную фигуру и помещает её в подготовленный фон. То есть тяжёлая часть работы переезжает с передачи данных на воспроизведение: клиенту нужно не просто распаковать файл, а фактически заново собрать изображение.

Авторы проверили идею на записях олимпийского фигурного катания — в относительно контролируемой сцене, где главный объект хорошо заметен, а фон меняется мало. В текущей реализации спортсмен выглядит скорее как двумерный элемент, наложенный на трёхмерную сцену. Поэтому зритель не может свободно обойти его камерой и увидеть убедительный ракурс, которого не было в исходной записи. Для построения фона использовали инструменты, которые объединяют признаки из нескольких сцен в общую трёхмерную модель.

Дальше системе придётся справляться с куда более трудными случаями: футболом и гимнастикой, где несколько спортсменов перекрывают друг друга, камера активно движется, а взаимодействия между людьми сложнее. Авторы также видят следующий шаг в создании движущегося объёмного персонажа, которого можно рассматривать с произвольной точки. Для этого нужно надёжно восстановить трёхмерные позы даже по одной камере и объединить неполные трёхмерные данные из разных съёмок. Пока воспроизведение сделано в Unity, но сама схема не привязана к этому движку.

Ключевые цифры

более 99,9%Поток данных стал меньше настолько, что этот подход потенциально может резко снизить объём трафика при подходящих сценах.

Можно ли доверять

Это препринт на arXiv, а не статья, прошедшая рецензирование. Проверка была частичной и опиралась на записи олимпийского фигурного катания, поэтому надёжность результата для футбола, гимнастики и других сцен пока не подтверждена; сами авторы отдельно отмечают высокую нагрузку на устройство зрителя и проблемы с переносом метода на более сложные случаи.

Пересказано ИИ по научной статье. Как это устроено

Источник и детали
ЖурналarXiv (cs.AI)
Дата публикации у нас17 сентября 2026 г.
Дата источника16 сентября 2026 г.
ОригиналОткрыть
АвторыEmanuele Artioli, Daniele Lorenzi, Shivi Vats, Farzad Tashtarian, Christian Timmerer