@media print{*{color:#000!important;background:#fff!important;border-color:#000!important}} ← 返回主页

🔀 视触觉多模态混合架构

分布式混合模型 · 逐层交叉反馈融合 · 3.0M参数

🔀 视触觉多模态混合架构 — 逐层交叉反馈融合

分布式混合模型: 每层VLA通过Cross-Attention接收世界模型潜空间Z
RGB+Touch+State 输入 multi Encoder VLA Layer 1 Transformer Encoder + Attention + FFN gate₁×1.0 Cross Attn VLA Layer 2 Transformer Encoder + Attention + FFN gate₂×0.1 Cross Attn VLA Layer 3 Transformer Encoder + Attention + FFN gate₃×0.01 Cross Attn 世界模型 GRU Encoder (2层) 历史状态编码 z₁ Pred (256D·空间) z₂ Pred (256D·物体) z₃ Pred (128D·语义) H-JEPA 能量损失 L = L_act + λ·L_energy 训练时激活 | 推理时剥离 z₁ z₂ z₃ Feature Fusion → DiT Action [14, 7] 图例 VLA正向流 WM潜空间注入 VLA→WM反馈 动作输出

⚙️ 推理模式

🔧 训练模式
世界模型反馈 · 三层门控激活
Cross-Attn注入z₁/z₂/z₃
H-JEPA能量损失联合优化
⚡ 推理模式
gate全部归零
世界模型剥离
零额外开销 · 纯VLA+DiT

🖼️ 架构图库

📁
拖拽图片到此处 或 点击上传
支持 JPG / PNG / GIF / WebP / SVG
✏️
Draw.io 架构图
点击已保存的架构图直接进入编辑器修改
加载中...
+ 新建架构图