垂直领域专用模型池 · 5维时空打标 · 条件编码分发 · 强化学习闭环
当前具身智能行业存在两条泾渭分明的技术路线。第一条路线追求「万能通用智能体」——训练一个超大参数模型,试图覆盖从感知、推理到执行的全场景需求,以参数规模换取泛化能力。第二条路线则先训练具备基础世界认知能力的模型,再针对具体场景进行后训练,将其转化为垂类场景专家,以场景深度换取确定性和可靠性。
Z-MAX 坚定选择后者。全局数据空间以 DDS 为数据总线,以 UNS 统一命名空间为数据组织架构,以 5 维时空打标(X·Y·Z·T·S)为数据质量管理基准,以 垂直领域专用模型池(ACT / VLA-T / zFlow / GR00T / ThinkAct)为核心推理引擎,以 原子技能 + 残差 RL为动作执行框架,形成条件编码 → 模型路由 → 动作执行 → 数据回灌 → 模型更新的完整闭环,最终实现从 95% 到 99% 成功率的持续进化。这一决策的根因在于工业场景对确定性、可靠性和低延迟的刚性要求——产线上的每一次抓取、每一次插入、每一次检测都不容许概率性的「差不多」。
通用大模型面对同一输入可能产生不同输出(概率采样),工业场景不可接受。模型池中每个模型只处理其擅长的条件子集,输出确定、可复现。
通用大模型推理延迟受参数规模制约(7B参数需~280ms)。模型池中 ACT(~10M) 和 zFlow(~18M) 可在 Orin Nano 上实现 <5ms 推理,满足力控闭环 >1kHz 的实时性要求。
通用大模型微调可能造成灾难性遗忘。模型池中每个模型独立训练、独立部署、独立回滚。VLA-T 的力控策略升级不影响 GR00T 的光口插拔能力。
垂域模型训练所需数据量远小于通用大模型。结合数据回流机制和智能标注,模型池可以在真实产线数据上持续进化,无需海量预训练语料。
全局数据空间(DDS Global Data Space)是模型池策略的使能层。它不是一个数据库或消息队列,而是一套以数据为中心的分布式架构——所有传感器、编码器、模型、执行器和反馈通道都在同一个命名空间下读写数据,彼此不关心对方的物理位置或编程语言。
在这个架构中,数据质量管理不是事后补救,而是嵌入全链路的原生能力:从传感器采集的那一刻起,每一帧图像、每一组力觉读数、每一次动作指令都被打上 5 维时空标签(X·Y·Z·T·S),在数据空间中形成可追溯、可检索、可回流训练的完整证据链。这正是 Z-MAX 与「端到端黑箱推理」路线的本质差异——我们不仅要智能,更要可解释、可审计、可进化的智能。
| 维度 | 定义 | 数据表达 | 质量目标 |
|---|---|---|---|
| X·Y·Z | 工位空间坐标 | 每台机器人/工位的物理位置 | ±0.05mm |
| T | 时间轴 | 采集时刻、动作时间戳、同步时钟 | <1ms 同步 |
| S | 语义层 | 感知 · 特征 · 条件 · 动作 · 反馈 五层 | 全链路可追溯 |
UNS(Unified Namespace)以一致且标准化的方式组织实时工业数据,核心目标是消除数据孤岛。
| 步骤 | 维度 | 打标内容 | 示例:P004「缺陷识别」 |
|---|---|---|---|
| 第1步 | S=sensor | 传感器类型 + 工位坐标 | 高分辨率相机@I-103 / 显微镜@I-103 |
| 第2步 | S=feature | 提取的特征 | 缺陷边缘检测 / 异物颗粒计数 |
| 第3步 | S=condition | 判断条件 | 漏检率<0.5% · 误判率<1% |
| 第4步 | S=action | 执行动作ID | A008:AOI缺陷检测 · 3D识别 · 分级 |
| 第5步 | S=feedback | 反馈标准 | 检出率>99.7% · 漏检率<0.3% |
DDS 不仅是「发布-订阅」消息传递,更是一块全局共享白板:所有节点都能发布或读取数据,不关心对方在哪台机器、用什么语言。以数据为中心,提供丰富的 QoS 策略保障实时、高效、灵活分发。
| 条件ID | 场景描述 | → 垂直领域专用模型 | → 动作 | 延迟 | 推理层 |
|---|---|---|---|---|---|
| C001 | 100G取料·视觉定位 | ACT 动作分块 | A01取料 | <5ms | Sys1·Orin |
| C004 | 400G插入·六维力控 | VLA-T 力控VLA ⭐ | A04插入 | <5ms | Sys1·Orin |
| C014 | 400G光口·力控插拔 | GR00T N1.7 | A22-A25 | ~280ms | Sys2·4090 |
| C039 | 透镜对准·亚微米耦合 | zFlow H-JEPA | — | <5ms | Sys1·Orin |
| C047 | 多模态异常检测 | ThinkAct 反思修正 | S01-S04 | <10ms | Sys2·4090 |
StageACT 提出了阶段条件化模仿学习框架——将长时域任务分解为离散阶段(S1 接近把手→S2 抓握→S3 转动→S4 拉开→S5 通过),底层策略以 One-hot 阶段向量为条件输入。核心洞见:同一观测在不同阶段有完全不同的最优动作——机器人看到门把手时,是伸手还是拉回,取决于当前处于哪个阶段。这一机制天然解决了观测歧义,并赋予了策略在失败时自主回退到正确阶段的恢复能力。
Z-MAX 将 StageACT 的阶段条件化思想深度集成到 DDS 数据质量管理体系中,形成三级条件编码架构:① VLM 高层阶段识别(视觉语言模型自动标注当前任务阶段)→ ② 条件编码器中层映射(阶段标签 → 256维条件向量 → 模型路由)→ ③ 底层策略阶段条件化执行(每个垂域模型接收阶段条件,在正确的时间执行正确的动作)。这不仅是一种模仿学习技巧,更是一套通用任务结构化 + 质量可追溯 + 模型可演进的数据驱动范式。
▲ 三级条件编码架构:从 VLM 语义理解到底层策略阶段条件化执行的全链路
不同任务之间存在大量可复用的子轨迹和任务片段。例如"接近目标"(S1)在开门、开抽屉、抓取零件时几乎完全一致。将这些基础动作片段抽离为共享的阶段模板,新任务只需组合已有阶段即可快速学习,极大降低数据采集成本。DDS 原子技能体系(242条)正是这一思想的落地——每个子轨迹就是一个可检索、可复用的标准化数据单元。
StageACT 论文明确指出未来将使用视觉语言模型(VLM)在训练期间自动标注阶段,并最终在测试时作为高层分类器。Z-MAX 的落地路径:VLM 观察产线摄像头 → 识别当前工序阶段("正在贴片""正在打线""正在目检")→ 自动生成 One-hot 阶段标签 → 注入条件编码器。这彻底解决了人工标注阶段的瓶颈,形成"VLM 大脑 + 阶段条件化策略小脑"的分层智能架构。
StageACT 的实验证明:阶段条件化框架与具体物理形态解耦。只要将任务合理拆解为阶段,无论是推门/拉门、左铰链/右铰链,都能用同一套逻辑解决。Z-MAX 将此推广到产线场景:"取料"阶段在 100G 光模块和 400G 光模块上是同一套阶段模板,只需微调传感器参数和力控阈值。这正是 DDS 54 条件场景可覆盖数百种实际工况的根本原因。
| StageACT 阶段 | 产线工序映射(800G DR8) | 典型工位示例 | → 条件编码策略 | → 模型路由 |
|---|---|---|---|---|
| S1 上料定位 | 物料进入工位 · 视觉定位与识别 | I-101 拆包上料 · I-102 扫码绑定 | 视觉特征(D405 RGB-D)+ 空间坐标编码(X·Y·Z)+ MES料号验证 | ACT 视觉伺服定位 |
| S2 取放对准 | 夹爪/吸嘴抓取工件 · 精确定位到目标工装 | I-111 DA贴片取料 · I-121 固晶点胶对准 | 力觉特征(六维力MLP: Fx/Fy/Fz/Mx/My/Mz)+ 触觉确认(真空吸附/夹持力) | VLA-T 力位混合控制 |
| S3 核心工艺 | DA贴片 · WB金线键合 · 透镜耦合 · 等离子清洗 · UV固化 | I-112 DA贴片(±5μm)· I-122 金线键合 · I-131 自动耦合(亚微米) | 力控曲线(接触检测→恒力保持→释放检测)+ 关节状态(7轴角度/速度/扭矩)+ MES工艺参数 | VLA-T 精密力控 / zFlow 亚微米对准 |
| S4 工序流转 | 工位间物料传递 · 料盘/料箱/托盘转运 · 老化箱进出 | I-141 贴片→打线流转 · I-151 烘烤上下料 · I-161 BI老化箱 | 视觉跟踪(多相机接力)+ 安全信号(区域光栅/急停)+ 碰撞检测(力阈值监控) | ACT 搬运轨迹 / Z100L 轮式双臂 |
| S5 质量门禁 | AOI外观检测 · 端面检测 · OE测试 · 数据回灌训练 | I-171 AOI检测 · I-181 端面清洁+检测 · I-191 OE出货检查 | AOI视觉检测结果(缺陷分类+位置)+ 力曲线分析(全程力控合规率)+ 节拍记录(各阶段耗时) | ThinkAct 反思判定+数据回灌 |
| 模型 | 参数量 | 定位 | 适用场景 | 技术来源 |
|---|---|---|---|---|
| ACT | ~10M | 动作分块 | 取料·扫码·放置 | CoRL 2023 |
| VLA-T | ~450M | 力控VLA ⭐ 核心主力 | 力控插拔·精密力位混合 | 自研VTLA |
| zFlow H-JEPA | ~18M | 预测编码·潜空间 | 透镜对准·自主安全检测 | H-JEPA架构 |
| GR00T N1.7 | ~1.7B | 云端训练·大参数推理 | 复杂光口插拔·多工位联动 | NVIDIA |
| ThinkAct | ~7B | 反思修正·长程规划 | 异常检测·自主纠错 | NVIDIA双系统架构 |
奖励 = 条件匹配 + 动作精度 + 力控安全 + 节拍效率
| 奖励分量 | 计算方式 | 权重 |
|---|---|---|
| 条件匹配 | 当前条件与预测条件的余弦相似度 | 0.3 |
| 动作精度 | 末端位姿与目标位姿的负欧氏距离 | 0.3 |
| 力控安全 | -|实际力 - 目标力| / 力阈值 | 0.2 |
| 节拍效率 | - 实际耗时 / 目标节拍 | 0.2 |
| 反馈类型 | 数据内容 | 用途 |
|---|---|---|
| 成功轨迹 | 完整动作序列 + 传感器数据 | 扩充训练集 · 行为克隆 |
| 失败轨迹 | 失败点 + 力曲线 + 视觉图像 | 困难样本挖掘 · 长尾增强 |
| 力控曲线 | 六维力时序数据 | 力控策略优化 |
| 节拍数据 | 各步骤耗时 | 效率优化 · 瓶颈识别 |
传感器数据完整性检查。不达标 → 重新采集
质检抽样通过。不达标 → 退回重标
训练集 vs 验证集一致性。不达标 → 扩充数据
验证集 A/B 对比。不达标 → 拒绝部署
一条主线:条件驱动 · 数据闭环 · 持续进化
两个引擎:左侧控制流程(条件→模型→动作)+ 右侧质量监督(门禁→验证→回灌)
三个层级:系统0(执行·Orin Nano)→ 系统1(推理·4060)→ 系统2(训练·4090)
四个核心:54条件 + 5模型 + 48动作 + 4机器人
五个维度:X·Y·Z 空间 + T 时间 + S 语义(感知/特征/条件/动作/反馈)
六步闭环:采集 → 标注 → 训练 → 部署 → 执行 → 回灌
垂直领域专用模型池 · 5维时空打标 · 条件编码分发 · 强化学习闭环
目标:从 95% 到 99% 成功率的持续进化
Z-MAX 静界科技 · 全局数据空间数据质量管理策略