文中系统地梳理了常见的三维模型表示方法, 包括点云、体素、网格、边界表示(boundary representation,B-Rep), 以及以符号距离场(SDF)和神经辐射场(NeRF)为代表的隐式表示, 介绍了它们在几何精度、计算效率和适用场景等方面的差异; 进一步, 探讨点云到网格、点云到B-Rep、体素与网格、网格与B-Rep, 以及网格与隐式表示之间的转换技术, 涵盖从传统几何算法到基于深度学习的智能方法; 分析了现有方法在计算精度、拓扑一致性、计算效率等方面的优劣, 指出当前转换技术面临高分辨率模型处理效率低下、复杂拓扑结构保持困难等关键挑战. 分析表明, 未来研究应着重发展多模态融合表示方法, 优化高精度转换算法, 开发面向特定行业的专用转换技术, 并积极探索AI驱动的智能转换范式, 为智能制造、数字孪生等领域的创新发展提供关键技术支撑。
在城市计算等场景中,多元时空序列数据存在显著的空间异质性与任务差异性。本部分聚焦“时空基础模型”,系统介绍城市时空基础模型的演进发展,阐述如何通过统一架构对多城市、多模态、多场景数据进行建模,实现跨城市泛化、多源数据统一处理及多任务灵活适配。在设计上,采用多视角分块化机制表征异构数据,结合自监督任务增强表示能力,并构建统一的提示调优框架,融合任务特定与数据驱动信号。报告还将展示如何从复杂时序中提炼普适的结构化表达,解决结构、动态与任务异质性,推动城市智能决策中模型的统一与通用部署。
本报告系统梳理了 4D 高斯数字人动画的采集与驱动技术,重点涵盖从采集到驱动的整体系统架构、采集系统的搭建与同步方法,以及基于空间结构参数的动画驱动机制。报告首先介绍多视角相机阵列与同步触发系统的集成方案,包括时间码同步、几何标定及多源数据融合流程,用于获得连续、时空一致的高斯点云序列。随后,报告分析数字人驱动方法中基于同构网格的低维几何特征表示的技术路线,该方法绕开传统基于时间序列的驱动方式,也不依赖 3DMM 模板参数,而是通过结构一致性约束建立高斯点云与目标网格之间的映射关系,实现动画形变与运动控制。最后,报告总结该技术体系在实时渲染、多人交互和虚实融合应用中的可行性与优势,并对其在沉浸式数字人表现与内容生产中的应用前景进行讨论。
在本次报告中,我们将分析最近几何表征发展的特点,分析内在的规律,介绍几何表征的挑战和相关应用。介绍高斯泼溅的最新进展,包括如何对高斯泼溅进行大尺度变形、解耦和重光照,以及如何对基于高斯泼溅表征的数字人进行实时重光照。同时,生成模型不仅在影响三维重建的方法,还给渲染带来了新的求解思路。其中,视频生成模型给生成式渲染带来了全新的思路。我们将介绍基于生成模型的视频编辑与合成方法,将介绍基于线稿交互的视频编辑方法,和基于点云几何先验的大视角视频编辑与合成方法。
随着人工智能技术的快速发展,开放世界中的场景重建生成与理解成为AR/VR、机器人、自动驾驶等领域的核心挑战。在真实环境中,AI系统不仅需要处理已知类别和结构化场景,还需应对未知对象、动态变化以及无限场景边界的复杂问题。面对大尺度、动态变化的复杂环境,如何实现实时稳定的跟踪注册以及高效完整的三维场景构建,是实现开放世界场景自主理解和交互的基础。本次报告将探讨如何通过端云协同的智能虚实融合与生成的架构,突破传统视觉定位与重建的瓶颈,实现更智能、更鲁棒的混合现实与三维重建生成,从而有助于AI对未知环境的自主理解与交互。