@media print{*{color:#000!important;background:#fff!important;border-color:#000!important}}
📄 导出PDF
← 返回主页
🔀 视触觉多模态混合架构
分布式混合模型 · 逐层交叉反馈融合 · 3.0M参数
🔀 视触觉多模态混合架构 — 逐层交叉反馈融合
分布式混合模型: 每层VLA通过Cross-Attention接收世界模型潜空间Z
RGB+Touch+State 输入
multi Encoder
VLA Layer 1
Transformer Encoder
+ Attention + FFN
gate₁×1.0
Cross
Attn
↕
VLA Layer 2
Transformer Encoder
+ Attention + FFN
gate₂×0.1
Cross
Attn
↕
VLA Layer 3
Transformer Encoder
+ Attention + FFN
gate₃×0.01
Cross
Attn
↕
世界模型
GRU Encoder (2层)
历史状态编码
z₁ Pred (256D·空间)
z₂ Pred (256D·物体)
z₃ Pred (128D·语义)
H-JEPA 能量损失
L = L_act + λ·L_energy
训练时激活 | 推理时剥离
z₁
z₂
z₃
Feature Fusion → DiT
Action [14, 7]
图例
VLA正向流
WM潜空间注入
VLA→WM反馈
动作输出
⚙️ 推理模式
🔧 训练模式
世界模型反馈 · 三层门控激活
Cross-Attn注入z₁/z₂/z₃
H-JEPA能量损失联合优化
⚡ 推理模式
gate全部归零
世界模型剥离
零额外开销 · 纯VLA+DiT
🖼️ 架构图库
📁
拖拽图片到此处 或 点击上传
支持 JPG / PNG / GIF / WebP / SVG
选择文件
✏️
Draw.io 架构图
点击已保存的架构图直接进入编辑器修改
加载中...
+ 新建架构图