编者寄语

体积视频是人工智能、计算机视觉与计算机图形学深度融合的重要研究方向,也是推动沉浸式媒体、数字孪生、虚拟现实等未来数字产业发展的关键技术。相较于传统二维视频,体积视频能够对动态场景进行连续时空建模与三维重建,实现自由视角浏览与沉浸式交互体验,正在深刻改变影视娱乐、虚拟直播、数字文旅、智慧教育等领域的内容生产与传播方式。近年来,随着神经渲染、三维表示学习与生成式人工智能的发展,体积视频在动态重建与真实感渲染方面取得了显著进展。然而,其在复杂动态场景建模、时空一致性、跨场景泛化以及存储与计算效率等方面仍面临挑战,高质量、实时化、低成本的体积视频生成与渲染仍有较大提升空间。相关关键技术的突破,将推动三维视觉内容向智能化、规模化与实时化方向发展。因此,系统研究体积视频的基础理论、关键技术与应用体系,对于提升我国在沉浸式媒体与智能视觉生成领域的自主创新能力、赋能数字经济与未来数字交互生态发展具有重要战略意义。

本期聚焦体积视频相关技术探索与实践,涵盖从三维表征基础理论、动态时空序列建模,到 4D‑高斯数字人采集驱动、生成式虚拟内容创作、端云协同部署等方向。通过这些资源,读者可以从不同角度厘清体积视频完整的技术链路、各类三维重建方案的适用场景,以及沉浸式视觉技术的最新发展趋势。相关研究展示了体积视频在虚拟文娱、数字孪生等场景当中的多样化实践,也为后续的科研攻关与产业落地提供启发和参考。


编委主任:苏金树 CCF会士 军事科学院教授

本期主编:杨   鑫 CCF计算机辅助设计与图形学专委会秘书长 大连理工大学教授

典型三维模型表示方法转换技术综述

文中系统地梳理了常见的三维模型表示方法, 包括点云、体素、网格、边界表示(boundary representation,B-Rep), 以及以符号距离场(SDF)和神经辐射场(NeRF)为代表的隐式表示, 介绍了它们在几何精度、计算效率和适用场景等方面的差异; 进一步, 探讨点云到网格、点云到B-Rep、体素与网格、网格与B-Rep, 以及网格与隐式表示之间的转换技术, 涵盖从传统几何算法到基于深度学习的智能方法; 分析了现有方法在计算精度、拓扑一致性、计算效率等方面的优劣, 指出当前转换技术面临高分辨率模型处理效率低下、复杂拓扑结构保持困难等关键挑战. 分析表明, 未来研究应着重发展多模态融合表示方法, 优化高精度转换算法, 开发面向特定行业的专用转换技术, 并积极探索AI驱动的智能转换范式, 为智能制造、数字孪生等领域的创新发展提供关键技术支撑。

格式:
文章
时空轨迹自监督学习

时空轨迹数据是行人、车辆或其他对象在地理空间中的出行或移动行为的记录,通常表示为带时间戳的地点序列。时空轨迹数据挖掘在智能交通系统和基于位置的服务中具有至关重要的作用,包括了未来轨迹预测、相似轨迹搜索、稀疏轨迹恢复、行程时间估计、轨迹仿真生成等各种有挑战的挖掘任务,其中轨迹的表示学习是这些挖掘任务的基础。本报告将介绍当前流行的自监督轨迹表示学习方法,分别讨论基于词嵌入的轨迹表示学习、基于自编码器的轨迹表示学习、基于对比学习的轨迹表示学习、基于扩散模型的轨迹生成以及轨迹大模型等相关研究进展。

格式:
视频
面向跨城市、跨场景、跨任务的时空序列统一建模

在城市计算等场景中,多元时空序列数据存在显著的空间异质性与任务差异性。本部分聚焦“时空基础模型”,系统介绍城市时空基础模型的演进发展,阐述如何通过统一架构对多城市、多模态、多场景数据进行建模,实现跨城市泛化、多源数据统一处理及多任务灵活适配。在设计上,采用多视角分块化机制表征异构数据,结合自监督任务增强表示能力,并构建统一的提示调优框架,融合任务特定与数据驱动信号。报告还将展示如何从复杂时序中提炼普适的结构化表达,解决结构、动态与任务异质性,推动城市智能决策中模型的统一与通用部署。

格式:
视频
4D高斯数字人动画采集与驱动技术

本报告系统梳理了 4D 高斯数字人动画的采集与驱动技术,重点涵盖从采集到驱动的整体系统架构、采集系统的搭建与同步方法,以及基于空间结构参数的动画驱动机制。报告首先介绍多视角相机阵列与同步触发系统的集成方案,包括时间码同步、几何标定及多源数据融合流程,用于获得连续、时空一致的高斯点云序列。随后,报告分析数字人驱动方法中基于同构网格的低维几何特征表示的技术路线,该方法绕开传统基于时间序列的驱动方式,也不依赖 3DMM 模板参数,而是通过结构一致性约束建立高斯点云与目标网格之间的映射关系,实现动画形变与运动控制。最后,报告总结该技术体系在实时渲染、多人交互和虚实融合应用中的可行性与优势,并对其在沉浸式数字人表现与内容生产中的应用前景进行讨论。

格式:
视频
基于高斯泼溅和视频生成模型的虚拟内容创作方法研究

在本次报告中,我们将分析最近几何表征发展的特点,分析内在的规律,介绍几何表征的挑战和相关应用。介绍高斯泼溅的最新进展,包括如何对高斯泼溅进行大尺度变形、解耦和重光照,以及如何对基于高斯泼溅表征的数字人进行实时重光照。同时,生成模型不仅在影响三维重建的方法,还给渲染带来了新的求解思路。其中,视频生成模型给生成式渲染带来了全新的思路。我们将介绍基于生成模型的视频编辑与合成方法,将介绍基于线稿交互的视频编辑方法,和基于点云几何先验的大视角视频编辑与合成方法。

格式:
视频
端云协同的混合现实与重建生成

随着人工智能技术的快速发展,开放世界中的场景重建生成与理解成为AR/VR、机器人、自动驾驶等领域的核心挑战。在真实环境中,AI系统不仅需要处理已知类别和结构化场景,还需应对未知对象、动态变化以及无限场景边界的复杂问题。面对大尺度、动态变化的复杂环境,如何实现实时稳定的跟踪注册以及高效完整的三维场景构建,是实现开放世界场景自主理解和交互的基础。本次报告将探讨如何通过端云协同的智能虚实融合与生成的架构,突破传统视觉定位与重建的瓶颈,实现更智能、更鲁棒的混合现实与三维重建生成,从而有助于AI对未知环境的自主理解与交互。

格式:
视频

本期编委成员