办公系统
个人会员
单位会员
首页 新闻中心 新闻资讯 正文

世界模型三十问(第二期)

2026-07-30

近年来,世界模型迅速崛起,成为人工智能领域最受瞩目的方向。什么是世界模型?它与我们熟知的大语言模型有何不同?它能否成为通往通用人工智能的关键路径?为帮助广大科技工作者准确把握世界模型的内涵外延、发展态势,中国电子学会编写了《世界模型三十问》。今天推送给大家的是第二期。


第6问 世界模型和多模态大模型的核心区别是什么?


多模态大模型的核心价值在于整合图像、文本、音频、视频等多类信息,完成场景识别、内容理解与素材生成,对动态变化感知较弱。

世界模型以多模态信息感知为基础,核心能力聚焦时空动态建模与物理规律推演,在认知当前场景的同时,能够持续预测环境状态变化、解析事件因果关系、支撑自主决策行为,实现从信息识别到动态智能推演的进阶,是适配真实复杂动态场景的高阶智能技术形态。


第7问 什么是VLM、VLN、VLA、VA、VLX,这类视觉多模态模型和世界模型存在怎样的技术关联?


VLM(Vision-Language Model,视觉—语言模型),指将视觉观测与自然语言对齐的多模态模型,核心是“看图说话、图文理解”,学习的是视觉与语言的统计关联。VLM可提供世界模型的感知与语义理解前端;世界模型可在VLM的语义表征基础上,进一步对时序物理动态演化过程进行建模,二者是“感知理解vs动态认知”的互补关系。

VLN(Vision-Language Navigation,视觉—语言导航),指在视觉环境中根据语言指令进行路径规划,是任务范式,而非单一模型。VLN需要世界模型提供环境动态预测与长期规划能力,以降低真实试错成本;世界模型可为VLN构建可交互的室内/城市模拟空间。

VLA(Vision-Language-Action,视觉—语言—动作模型),指将视觉感知、语言指令与机器人动作空间联合建模的模型架构,如RT-2、π系列等。VLA侧重“感知—语义—控制”的端到端映射;世界模型可为VLA提供内部行动预演与反事实评估,弥补VLA在物理推理与长期规划上的不足,二者常融合用于具身智能。

VA(Vision-Action,视觉—动作模型),指去掉语言模态,直接从视觉观测映射到控制动作的模型,常见于传统机器人控制。VA是VLA的简化版,世界模型可为VA补充对环境动态的显式建模,使其在场景中具备更强泛化与鲁棒性。

VLX(Vision-Language-X,视觉—语言—执行扩展架构),以视觉语言模型作为多模态感知与语义推理基础的可扩展模型架构。VLX是系统层概念,世界模型可作为其内部的模拟与规划引擎,在真正执行前做安全预演与策略筛选。


图片


第8问 世界模型语境下,VAM、WAM、AWM、VWM、GWM分别指什么?


VAM(Video Action Model,视频—动作模型),指以视频序列为输入/输出,对动作序列与未来观测结果进行联合建模的模型,常在生成式世界模型语境下使用,重点在像素空间刻画“动作→未来画面”。

WAM(World Action Model,世界—动作模型),指利用对未来世界状态的预测来指导动作生成的模型框架。WAM可以是视频型的VAM,也可以是抽象状态的JEPA型。

AWM(Agent World Model,智能体世界模型),更偏向智能体视角的世界模型,强调以智能体自身动作为驱动的世界状态转移建模,常用于具身智能、MBRL(基于模型的强化学习)论文中,突出“我是谁、我做什么、世界怎么变”。

VWM(Video World Model,视频世界模型),指在像素/视频帧空间预测未来,如Sora、Genie等。适用场景包括游戏剧情生成、影视预可视化、元宇宙环境生成等。

GWM(Geometric World Model,几何世界模型),以3D点云、网格、Gaussian Splatting(高斯泼溅)、NeRF(神经辐射场)等显式/半显式几何结构表征世界,常融合物理引擎。如NVIDIA Omniverse、World Labs、腾讯HY-World。可用于机械臂抓取、装配线仿真、工厂数字孪生、自动驾驶等。


图片


第9问 近期行业内提出的WVM是什么,与世界模型是什么关系?


WVM(World Value Model,世界价值模型)是近年来在机器人学与具身智能领域提出的一种新型框架,核心思想是在“世界模型(World Model)”强大的时空动态理解能力之上,叠加“价值估计(Value Estimation)”能力,让智能体不仅能预测物理世界“会发生什么”,还能评估“当前任务进展得如何”。


图片


第10问 什么是AC-WM,与WAM存在哪些核心区别?


AC-WM(Action-Conditional World Model,动作条件世界模型),是业界应用广泛的世界模型标准架构,以环境观测与智能体动作作为双重输入,用于建模动作干预下环境的时序演化与物理交互结果。AC-WM与WAM是当前世界模型领域两条完全不同的主流技术范式,AC-WM代表“先给定动作、再推演环境变化”的传统仿真建模路线;WAM属于“预测驱动决策”,将环境预测作为策略学习的引导信号,二者技术逻辑不同,是行业易混淆的概念。

返回列表页

加入会员

学会官微