Исследователи из Гонконгского китайского университета (Chinese University of Hong Kong, CUHK) и Tencent представили систему CubeComposer, которая позволяет генерировать панорамное видео с разрешением до 4K (3840×1920) на основе обычной видеозаписи с одной камеры. В отличие от большинства существующих решений, модель сразу создаёт видео в высоком разрешении, а не повышает его с помощью постобработки.

Задача преобразования обычного видео в панорамное остаётся одной из наиболее сложных в области генеративных моделей. Алгоритму необходимо не только достроить области, отсутствующие в поле зрения камеры, но и сохранить геометрию сцены, согласованность движения объектов и непрерывность изображения по всей сфере. Многие современные модели ограничиваются разрешением около 1024×512 пикселей из-за высокой вычислительной стоимости механизмов полного внимания, применяемых в диффузионных моделях.

В CubeComposer проблема решается иначе. Вместо генерации всей сферической панорамы за один проход система преобразует изображение в формат кубической проекции, представляющий сцену шестью квадратными гранями куба. Затем видео генерируется последовательно — как по времени, так и по отдельным граням — с использованием пространственно-временной авторегрессии.

Приоритет отдаётся тем граням, которые лучше всего наблюдаются исходной камерой. После этого информация о геометрии, текстурах и движении распространяется на менее наблюдаемые участки сцены, что позволяет достраивать области, отсутствующие в исходной записи.

Для работы с длинными видеопоследовательностями авторы также предложили механизм разреженного внимания, который снижает вычислительную сложность обработки длинного контекста практически до линейной зависимости вместо квадратичной. Это делает возможной генерацию панорамного видео в разрешении 4K без чрезмерного роста требований к вычислительным ресурсам.

Ещё одной проблемой кубической проекции являются заметные швы. Для их устранения разработчики использовали специальное позиционное кодирование, учитывающее реальную топологию куба, а также копирование, поворот и последующее смешивание пограничных областей соседних граней. Благодаря этому после обратного преобразования в сферическую проекцию изображение сохраняет непрерывность.

Для обучения модели исследователи подготовили новый набор данных 4K360Vid, включающий 11 832 панорамных видеоролика в разрешении 4K. Базовой генеративной моделью стала открытая Wan 2.2 5B, а перспективные видеоролики и траектории камеры синтезировались автоматически для имитации реальной съёмки.

По данным авторов, существующие решения обеспечивают нативную генерацию примерно до разрешения 1K, а получение более высокого качества требует применения отдельных моделей суперразрешения. CubeComposer же непосредственно генерирует панорамное видео с разрешением 2048×1024 и 3840×1920, что позволяет сохранить больше пространственных деталей и избежать ошибок, которые невозможно исправить обычным масштабированием.

Авторы отмечают, что последовательная генерация отдельных граней и временных окон увеличивает время вывода по сравнению с традиционными методами. В дальнейшем они планируют изучить более быстрые алгоритмы генерации и адаптировать технологию для интерактивных ВР-приложений с низкой задержкой.

Отчёт сопровождают онлайн-демонстрация и исходный код.

Не пропускайте важнейшие новости о дополненной и виртуальной реальности — подписывайтесь на Голографику в Телеграме, Максе, ВК и X! Поддержите проект на Бусти.

Далее: Elio привлекла $21 млн на оптические датчики, которые знают, на что смотреть