在未来的AI发展中,世界模型将成为关键领域之一。尽管过去几年生成式AI的兴起让机器语言理解能力备受瞩目,但面对实际应用场景(如智能驾驶和实体智能),单靠语言理解远远不够。AI还需具备空间感知、环境理解及对行动后果的预判能力,而世界模型正是实现这些能力的重要技术路径。
各大企业对此领域展开了激烈竞争。李飞飞创立的World Labs在短时间内实现了高度增长,其新发布的Atlas世界模型旨在整合空间生成、真实场景重建与时空模拟。谷歌DeepMind推出的Genie 3则注重实时交互,创造可与用户探索动态生成的环境,而英伟达发布的Cosmos 3则着眼于开放世界基础模型。在国内,高德推出的ABot-Earth 0.7则标志着首款3D原生城市世界模型,专注于真实世界的再现与推演。
随着AI逐步融入现实世界,它将面临复杂的时间空间变化和意外情况。比如,儿童在无语言能力时即开始探索世界,通过简单动作学习距离、方向和物体运动等物理概念。这表明,对世界的理解并非完全依赖语言。李飞飞在万字长文中指出,空间智能在人们与物理世界的互动中起着至关重要的作用,如停车时的间距判断和在人群中的避让。空间智能不仅在于识别图像,更重要的是将感知、想象、推理与行动相结合,这也是AI需要突破的方向。 龙8头号玩家
李飞飞为世界模型提出的三项要求包括:能生成几何、物理和动态一致的世界;能处理多模态信息如图像、视频及动作;能根据动作预测环境变化。尽管行业未形成统一的解决方案,各个团队依然在朝着这一方向探索。
在理解世界模型这个复杂概念时,各个团队的思路有所不同。World Labs关注三维结构生成与模拟,而Meta AI的杨立昆则倡导的联合嵌入预测架构JEPA,则旨在通过抽象化来捕捉环境中的重要结构与变化。不同的技术路径最终都聚焦于同一个核心问题:如何理解环境,以便更好地服务于互动与行动。
高德选择从具体出行任务入手,构建一种由三层能力构成的空间智能底座。首先是动态感知能力,实时理解路况、人流和环境变化。结合这些能力,AI将能在真实世界中发挥更大的潜力。 龙8头号玩家