世界模型,是指智能体通过与环境交互,或通过观察物理世界的视觉表观演变,探索和推断内部动力学模型,构建物理世界的可微分模拟器。近十年间,J. Tenenbaum、J. Schmidhuber、Y. LeCun等人分别从贝叶斯认知理论、视觉环境决策、自监督学习的角度给出了世界模型的不同表达形式。然而,如何在复杂的视觉场景中建立有效的世界模型仍然是一项开放课题。本期SPP报告将围绕世界模型的“观察”与“交互”两个方面,分别介绍“3D逆图形学物理推断”和“基于世界模型的强化学习”方法,相关工作分别发表于2022年的ICML和NeurIPS(Spotlight)。
从视觉输入中感知并生成三维世界,是人类理解和与物理环境交互的根本能力。过去几十年中,计算机视觉在二维场景理解上取得了显著进展,但二维表征天然受到空间与时间信息缺失的限制,难以还原真实世界的三维复杂性。 我们如何让机器像人类一样去感知、重建并生成多样而动态的三维场景?又如何让它们在世界中思考与行动?在本次报告中,我将介绍一系列探索机器如何从视觉经验中学习三维结构的研究工作。这些系统基于可微分的场景表示,能够在无需大量监督的情况下实现跨场景泛化的三维重建与理解。更进一步,这些三维感知模型不仅让机器能够解释世界,更为其生成与交互世界奠定了基础。我将展示如何利用三维建模的先验与物理一致性,发展出高保真的三维生成模型,使AI能够结构化地控制场景与物体、模拟真实世界的几何与动力学过程。这一研究方向旨在建立能够统一感知、生成与决策的世界模型(World Model),推动AI在空间推理、行动规划与创造性理解上的跃迁,最终迈向具有人类级空间智能的通用人工智能。
预训练世界模型是提升强化学习样本效率的关键技术,但现有方法因视频数据缺乏显式动作标注,难以捕捉状态转移的因果机制。对此,提出多模态大模型辅助的视频动作生成预训练框架(MLM-generated Action-based Pre-training from videos for world models,MAPO),通过整合视觉语言模型的语义理解能力与动力学建模需求,突破传统预训练范式在动作语义缺失方面的局限性。具体地,MAPO在预训练阶段利用多模态大模型(QWEN2_5-VL-7B)解析视频帧序列,生成细粒度语义动作描述,构建具有因果解释性的动作-状态关联;设计上下文量化编码机制,解耦场景静态特征与动态控制因素,增强跨模态表征能力。在微调阶段,通过双网络协同架构实现预训练动力学特征与真实环境动作的端到端对齐。实验表明,MAPO在DeepMind Control Suite和Meta-World的8项任务中的平均回报较最优基线获得稳定提升,尤其在长时程任务中展现出卓越的性能。该研究为跨模态世界模型训练提供了新范式,揭示了语义动作生成在因果推理中的关键作用。
真实世界的具身交互场景中,机器人需应对环境动态变化、任务需求多样、响应实时的多重挑战,传统技术在感知泛化能力与决策精准度上难以兼顾。世界模型作为连接感知、决策与执行的核心枢纽,通过学习环境底层规律构建动态认知模型,可实现复杂场景的提前预判与自适应决策优化。本报告以自动驾驶、智能操作等典型具身场景为依托,系统阐述世界模型的核心架构、学习机制及落地路径。
在真实世界中学习具身操作技能代价昂贵,目前广泛采用的做法是基于仿真环境的学习和由虚到实迁移。但构建一个通用且高保真的仿真环境仍然非常困难,即便为某个单项任务构建相应的仿真环境也很难。同时,为使仿真训练的智能体能够由虚到实迁移,常需要在包括几何、结构、材质、动力学等的高维空间中进行采样,维数灾难问题突显。如能对目标环境快速构建一个机理化的专用世界模型,则只需在机理引导下对该模型进行小范围域随机化,即可支持鲁棒可泛化的策略学习。本报告分析和综述世界模型的发展脉络和最新进展,并探讨两种世界模型驱动的具身智能范式:1)直接在目标环境中采集“任务无关”的操作轨迹数据,学习符合物理规律的专用世界模型,用于多种下游任务的学习,其核心问题是如何基于稀疏轨迹数据学习符合物理规律的精准世界模型;2)首先基于大规模仿真预训练通用世界基础模型,再针对目标环境进行快速适配得到专用世界模型,用于目标环境多种下游任务的学习,其核心问题是如何实现通用世界模型的精准高效适配。最后尝试探讨和展望未来方向。