← 返回主页

🔀 SmolVLA × LeWM

分布式混合模型 · 逐层交叉反馈融合 · 3.0M参数

🔀 SmolVLA × LeWM 逐层交叉反馈融合

分布式混合模型: 每层VLA通过Cross-Attention接收世界模型潜空间Z
RGB + State 输入 SmolVLA Encoder VLA Layer 1 Transformer Encoder + Attention + FFN gate₁×1.0 Cross Attn VLA Layer 2 Transformer Encoder + Attention + FFN gate₂×0.1 Cross Attn VLA Layer 3 Transformer Encoder + Attention + FFN gate₃×0.01 Cross Attn LeWM 世界模型 GRU Encoder (2层) 历史状态编码 z₁ Pred (256D·空间) z₂ Pred (256D·物体) z₃ Pred (128D·语义) H-JEPA 能量损失 L = L_act + λ·L_energy 训练时激活 | 推理时剥离 z₁ z₂ z₃ Feature Fusion → DiT Action [14, 7] 图例 VLA正向流 WM潜空间注入 VLA→WM反馈 动作输出

⚙️ 推理模式

🔧 训练模式
世界模型反馈 · 三层门控激活
Cross-Attn注入z₁/z₂/z₃
H-JEPA能量损失联合优化
⚡ 推理模式
gate全部归零
世界模型剥离
零额外开销 · 纯VLA+DiT