世界模型元年来了?AI开始真正理解三维空间

文章配图

🌐 开头:大模型的下一个战场,不再是文字

两件事几乎同时发生:,2026年9月的第一周

斯坦福教授李飞飞联合创立的World Labs发布新一代世界模型Atlas,官网称其为"全球首个多模态世界模型",面向空间智能。9月1日

9月9日,京东在JDDiscovery大会发布实时可交互世界模型JoyAI-Echo WM,在WBench Navigation评测中以81.6分排名第一,并且径直开源。

一个美国,一个中国;一个学术背景,一个电商基因。但它们指向同一个判断:

大模型的下一个战场,是"世界"本身。


🤔 一、世界模型和ChatGPT有什么区别

1.1 一句话说清楚

大语言模型处理的是文字,视频生成模型处理的是像素,而世界模型处理的是空间本身——

物体的位置、形状、距离、空间关系,以及这些关系随时间的变化。

1.2 Atlas:把"空间"变成AI的理解对象

李飞飞对世界模型的定义是:能够理解、推理并交互于语义、物理、几何及动态维度上的复杂世界的产出模型。

这不是她的突发奇想。2025年11月她发表了《从文字到世界》长文,2026年6月又和团队发表《世界模型的能力分类》,把市面上的世界模型归纳为三类:渲染器、模拟器、规划器。

还能理解这个世界里物体的物理规律和动态关系。Atlas是这三条线的统合:它不只是"画"出一个世界

维度 LLM(文字) 视频模型(像素) 世界模型(空间)
理解对象 语义 视觉外观 几何+物理+动态
输出形态 文本 视频 可交互的世界
核心能力 推理 生成 模拟与规划

🚀 二、京东JoyAI-Echo WM:把世界模型装进实时交互

2.1 它做了什么

JoyAI-Echo WM能根据用户的移动和视角变化,持续产出整个世界:

  • 同步生成720P视频、环境音、音乐和语音
  • 支持第一人称、第三人称以及多轮连续交互
  • 在WBench Navigation评测中,画面质量、场景遵循、交互控制、一致性、物理合理性等维度综合得分81.6分,其中一致性高达89.8

2.2 别小看"一致性"这个数字

文章配图

世界模型最容易翻车的地方,就是前后不一致——你往前走两步回头看,场景应该和刚才一样,但很多模型会"忘了"。

意味着它已经能维持一个连贯的世界:你绕一圈回来,房子还在原处。JoyAI-Echo WM在一致性上拿89.8分

这是从"产出一段视频"到"生成一个可进入的世界"的关键一步。


🎮 三、谁会用世界模型:游戏、直播和机器人

3.1 三个最快的落地场景

情形 用途 进度
游戏 实时产出可探索的开放世界 京东称已可用于游戏
数字人直播 动态场景+环境声+语音同步 京东明确提及
具身智能 机器人仿真训练场 京东称提供技术支撑

3.2 为什么具身智能是关键

是训练场。机器人最缺的不是"脑子"

速度慢、成本高、还危险。世界模型可以提供逼真的虚拟环境,让机器人在里面跑几千个小时,把"摔倒"的成本降到接近于零。在真实世界训练机器人

京东在产业端讲仿真训练——两条线,最终交汇在"让AI理解物理世界"这个点上。李飞飞在学术端讲空间智能


⚖️ 四、世界模型的争议与冷静

4.1 三个现实问题

世界模型的评测标准还不统一。WBench只是其中一个基准,画面"好看"和世界"真实"是两回事。第一

第二,即时生成整个世界的算力成本极其高昂。720P+立体声+语音同步,对推理基础设施要求远高于文字模型。

第三,"可交互"的深度有限。目前更多是"视角变换",距离真正意义上的因果模拟——比如推倒一个多米诺骨牌看它连锁倒下——还有距离。

4.2 但方向已经清晰

李飞飞说空间智能是AI的下一个前沿,京东把世界模型放进自己的核心模型矩阵。当学术界和产业界同时押注同一个方向,这一般不是炒作,而是迁移的开始。

世界模型之于空间智能,可能就是当年的LLM之于语言智能。就像2022年的ChatGPT:第一版粗糙、有争议、被批评"不理解世界"。但五年后回头看


📌 本文要点回顾

  1. 9月1日李飞飞World Labs发布Atlas,9月9日京东发布JoyAI-Echo WM并开源,世界模型成为中美同台竞技的新战场
  2. 世界模型处理的是空间本身而非文字或像素,核心是几何、物理与动态关系
  3. JoyAI-Echo WM在WBench Navigation以81.6分排名第一,一致性维度89.8分,支持实时多轮交互
  4. 落地场景:游戏、数字人直播、具身智能仿真训练;与机器人产业直接相关
  5. 争议仍在(评测标准、算力成本、交互深度),但学术与产业同时押注,方向已经明确
0

评论0

请先
显示验证码
没有账号?注册  忘记密码?