← 主页

世界模型技术路线分支对比
当前世界模型的主要技术路线梳理 · Z-MAX 定位

版本:V1.0(2026-09)· 范围:具身智能/通用智能领域当前世界模型的主要技术路线分支 · 参照:具脑磐石 Cog-WM 1.0、Meta JEPA、OpenAI Sora、DeepMind Genie、π0 等公开信息

一、两大范式分野:像素重建 vs 隐空间预测

当前所有世界模型,最根本的分叉在一个问题上:世界模型要「重建什么」?这一问决定了数据需求、泛化能力、可解释性三大属性。

分野像素重建派(生成式)隐空间预测派(JEPA 系)
核心问题像素会怎么变(重建原始感官)与任务有关的状态会怎么变(预测抽象表征)
代表Sora、Genie 2/3、GAIA-1I-JEPA/V-JEPA、Cog-WM 1.0、Z-MAX 状态空间
数据需求高(需海量视频)低(隐空间学习目标小)
泛化靠数据堆叠外推靠机制复用(结构分离)
可解释性弱(黑盒生成)强(可归因机制)
代价算力/参数量大架构设计复杂
一句话:像素派「用更多数据补更多场景」,隐空间派「用机制换数据效率」。这是 2026 年世界模型最本质的分野,Z-MAX 与 Cog-WM 1.0 同属后者。

二、六大技术路线分支

① 视频生成世界模型(像素重建系)

代表:OpenAI Sora、Google DeepMind Genie 2/3、Wayve GAIA-1。机制:从海量视频学习世界规律,逐帧生成未来像素。Genie 系进一步从视频反推出可交互世界。优势:渲染逼真、任务通用。短板:算力/数据需求巨大,物理一致性靠规模「涌现」,缺乏可归因机制。

② 隐空间预测世界模型(JEPA 系 / 类脑)

代表:Meta I-JEPA / V-JEPA、具脑磐石 Cog-WM 1.0、Z-MAX 状态空间。机制:联合嵌入预测架构——在抽象隐空间预测「未来表征」而非重建像素,配合时空记忆、多层级预测。优势:低数据、高泛化、可归因。短板:表征设计需工程沉淀。

③ 扩散 / 流匹配动作模型(Action 生成系)

代表:Physical Intelligence π0 / π0.5、Diffusion Policy、Flow-Matching DiT。机制:动作空间做扩散或流匹配,把动作生成建模为去噪/输运过程。优势:多模态表达、动作平滑、长程任务强。短板:仍是「学映射」而非「学世界规律」,跨域泛化受限。

④ 端到端 VLA(视觉-语言-动作)

代表:Google RT-1/RT-2、OpenVLA、smolvla。机制:视觉-语言-动作统一到单一模型,语言指令直接驱动动作 token。优势:指令跟随、零样本任务泛化。短板:依赖大规模跨本体数据,精密物理操作仍需世界模型补足。

⑤ 模型基强化学习世界模型(Model-based RL)

代表:DeepMind Dreamer / DreamerV3、MuZero。机制:学习环境的转移模型(世界模型),在隐空间里做规划/想象,用价值函数引导。优势:样本效率高、能规划。短板:主要面向游戏/控制,连续精密操作落地少。

⑥ 显式物理引擎(非学习式)

代表:DeepMind MuJoCo、NVIDIA Isaac Sim。机制:显式物理定律建模(刚体/接触/约束),不学习、可微仿真。优势:物理精确、可审计。短板:非「认知」模型,泛化需人工建模,且常作为上述路线的训练/验证底座。

三、综合对比表

路线代表模型学习信号数据需求泛化方式典型任务
① 视频生成Sora / Genie / GAIA-1像素重建(监督)极高规模涌现通用视频/自驾仿真
② 隐空间预测(JEPA)I/V-JEPA / Cog-WM / Z-MAX隐空间预测(自监督)机制复用导航/精密操作
③ 扩散/流匹配动作π0 / π0.5 / Diffusion Policy动作模仿(监督)数据+架构通用操作
④ 端到端 VLART-2 / OpenVLA / smolvla动作 token(监督)跨本体数据指令跟随操作
⑤ Model-based RLDreamerV3 / MuZero奖励(强化学习)隐空间规划游戏/控制
⑥ 物理引擎MuJoCo / Isaac Sim显式物理(不学习)人工建模仿真/验证底座

四、Z-MAX 状态空间的定位

Z-MAX 状态空间属于② 隐空间预测(JEPA 系 / 类脑),但采取了一条混合务实路线——不「站队」,而是按能力档位把多条路线模块化编排进同一套状态空间底座:

档位采用的技术路线对应分支
L2 基础辅助YOLO + 前馈 MLP + 13 段状态机 + 原子技能⑥ 物理引擎底座 + ② 解析式状态空间
L3 高级自动SmolVLM 视觉编码 + Flow-Matching DiT 动作头④ VLA + ③ 流匹配动作
L4 专家自主JEPA 流形预测器 + 卡尔曼状态估计 + 流形导航 + 自主恢复② 隐空间预测(JEPA 系)+ ⑤ 世界模型规划
关键判断:Z-MAX 不是单纯的「隐空间预测」也不是单纯的「端到端 VLA」,而是以隐空间预测(JEPA 系)为世界模型底座,把端到端(L3)、解析式(L2)、世界模型(L4)按任务链深度分层——L2 保底、L3 泛化、L4 自主,出域交还、域内自主。这与 Cog-WM 1.0「同一套类脑机制、导航/操作两分支」的思路同构,但把「分支」换成了「能力档位」。
世界模型的竞争,正从单一的「大数据预训练」范式走向多元并存。Z-MAX 的选择是:不在范式之间二选一,而是在状态空间底座上,让 L2/L3/L4 三档各自调用最合适的那条路线。

🧠 状态空间白皮书 · 📋 功能清单 · 🏠 主页