办公系统
个人会员
单位会员
首页 新闻中心 新闻资讯 正文

世界模型三十问(第一期)

2026-07-29

近年来,世界模型迅速崛起,成为人工智能领域最受瞩目的方向。什么是世界模型?它与我们熟知的大语言模型有何不同?它能否成为通往通用人工智能的关键路径?为帮助广大科技工作者准确把握世界模型的内涵外延、发展态势,中国电子学会编写了《世界模型三十问》。从今天起,将分六期陆续推送给大家。


第1问 什么是世界模型?


世界模型作为人工智能领域的前沿方向,是具备对物理世界因果理解与未来推演能力的智能系统。相较于传统人工智能侧重语言逻辑与静态信息处理,世界模型能够深度感知空间结构、物理规则、时序变化与环境交互关系,依托现实场景观测实现未来状态预判与自主行为规划,有效弥合人工智能虚拟计算与真实物理场景应用之间的壁垒,为智能技术在真实物理世界落地赋能提供底层支撑。


第2问 世界模型是什么时候提出来的?


世界模型的雏形最早可以追溯到1943年。认知科学家Kenneth Craik在其著作《解释的本质》中提出:人在对现实作出反应之前,会先在大脑中构建一个“小规模的现实模型”,用来模拟可能发生的过程,再据此选择行动。这个理论后来被称为“心智模型”(Mental Model),也是世界模型在认知层面的源头。

到了20世纪90年代,强化学习领域的先驱Richard Sutton等人提出了Dyna架构,在强化学习领域首次将“世界模型”明确确立为智能体内部的一项基础能力—智能体在学习行动策略的同时,也要学习“如果我采取某个动作,世界会如何变化”。这奠定了世界模型在基于模型的强化学习(MBRL)中的核心地位。

2018年,谷歌大脑的David Ha和深度学习元老Jürgen Schmidhuber发表了题为《World Models》的论文,以VAE(变分自编码器)、MDN-RNN(混合密度网络循环神经网络)和轻量控制器组成了影响广泛、结构清晰的现代深度世界模型框架,成为现代世界模型的里程碑,带动了后续生成式与具身世界模型的发展。


第3问 世界模型的核心功能是什么?


基于李飞飞World Labs提出的三功能分类学,世界模型主要包含渲染器、模拟器、规划器三大核心能力,共同构成人工智能感知、推演、决策的完整闭环体系。其中,渲染器承担环境感知与可视化还原功能,主要解决“世界看起来怎样”的认知问题,能够精准复刻真实场景的空间形态、视觉特征与环境细节,为智能系统提供基础场景认知。模拟器是物理智能的核心载体,聚焦解决“采取动作后世界怎么变化”的推演问题,依托三维空间规律与物理规则,精准预判环境、物体的动态演化趋势,实现对真实世界因果逻辑的深度理解。规划器侧重智能决策与行为输出,解决“下一步做什么”的执行问题,结合场景感知结果与任务目标自主生成最优行动策略。当前三大功能模块正由独立运行加速走向深度融合,逐步形成一体化、端到端的通用世界模型能力体系。

图片


第4问 世界模型的基础特征是什么?


从技术本质来看,世界模型具备三项通用底层基础特征,分别为空间物理表征能力、时序预测能力与交互因果建模能力。其中,空间物理表征能力是模型对现实场景结构、物体属性及基础物理约束的统一建模能力;时序预测能力是指模型能够基于当前环境状态推演未来多步的场景演化结果;交互因果建模能力体现为模型可接收智能体动作输入,构建“环境观测—动作干预—状态更新”的完整因果链路,是区分世界模型与其他模型的关键。


第5问 世界模型和传统大语言模型的核心区别是什么?


传统大语言模型以文本数据训练为基础,核心能力集中在语言理解、逻辑梳理与内容生成,主要依托海量文本数据完成概率拟合,仅能实现虚拟场景下的信息交互与内容输出,缺乏对空间结构、物理规则和现实动态场景的认知能力。

世界模型以真实物理场景时序数据为训练基础,聚焦物理规律建模与场景状态动态推演,构建起对现实世界的空间认知、因果推理与风险预判能力,能够有效适配真实场景作业需求,推动人工智能从“数字世界”走向“物理世界”。

从预测目标看,大语言模型预测的是“下一个词元(token)”,根据前文概率,找出最可能接续的词元;世界模型预测的是“下一个状态”,根据当前状态和动作,推演世界下一秒会变成什么样。

返回列表页

加入会员

学会官微