← 返回主页
🔀 SmolVLA × LeWM
分布式混合模型 · 逐层交叉反馈融合 · 3.0M参数
🔀 SmolVLA × LeWM 逐层交叉反馈融合
分布式混合模型: 每层VLA通过Cross-Attention接收世界模型潜空间Z
RGB + State 输入
SmolVLA Encoder
VLA Layer 1
Transformer Encoder
+ Attention + FFN
gate₁×1.0
Cross
Attn
↕
VLA Layer 2
Transformer Encoder
+ Attention + FFN
gate₂×0.1
Cross
Attn
↕
VLA Layer 3
Transformer Encoder
+ Attention + FFN
gate₃×0.01
Cross
Attn
↕
LeWM 世界模型
GRU Encoder (2层)
历史状态编码
z₁ Pred (256D·空间)
z₂ Pred (256D·物体)
z₃ Pred (128D·语义)
H-JEPA 能量损失
L = L_act + λ·L_energy
训练时激活 | 推理时剥离
z₁
z₂
z₃
Feature Fusion → DiT
Action [14, 7]
图例
VLA正向流
WM潜空间注入
VLA→WM反馈
动作输出
⚙️ 推理模式
🔧 训练模式
世界模型反馈 · 三层门控激活
Cross-Attn注入z₁/z₂/z₃
H-JEPA能量损失联合优化
⚡ 推理模式
gate全部归零
世界模型剥离
零额外开销 · 纯VLA+DiT