Diffuman4D
Diffuman4D: 4D Consistent Human View Synthesis from Sparse-View Videos with Spatio-Temporal Diffusion Models
В этой статье рассматривается задача получения высококачественных изображений людей с использованием видеозаписей с ограниченным просмотром в качестве входных данных. Предыдущие методы решали проблему недостаточной наблюдательности, используя 4D-модели диффузии для создания видео с новых точек обзора. Однако сгенерированные видео с использованием этих моделей часто не имеют пространственно-временной согласованности, что ухудшает качество синтеза изображений. В этой статье мы предлагаем новый скользящий итеративный процесс устранения шума для повышения пространственно-временной согласованности 4D-модели диффузии. В частности, мы определяем скрытую сетку, в которой каждая скрытая точка кодирует изображение, позу камеры и позу человека для определенной точки обзора и временной метки, затем поочередно отключаем скрытую сетку в пространственном и временном измерениях с помощью скользящего окна и, наконец, декодируем видео в целевых точках обзора из соответствующих скрытых точек без шума. Благодаря итеративному перемещению информация в достаточной степени передается по скрытой сетке, что позволяет диффузионной модели получать большое поле восприятия и, таким образом, повышать согласованность выходных данных в формате 4D, одновременно снижая потребление памяти графического процессора. Эксперименты с наборами данных DNA-Rendering и ActorsHQ демонстрируют, что наш метод способен синтезировать высококачественные и непротиворечивые видеоролики для просмотра в режиме реального времени и значительно превосходит существующие подходы. Интерактивные демонстрации и видео-результаты смотрите на странице нашего проекта: https://diffuman4d.github.io/ .
✅https://arxiv.org/pdf/2507.13344 ✅https://diffuman4d.github.io/ ✅https://github.com/zju3dv/Diffuman4D