← 返回首页

全局数据空间的数据质量管理策略

垂直领域专用模型池 · 5维时空打标 · 条件编码分发 · 强化学习闭环

全局数据空间以 DDS 为数据总线,以 UNS 统一命名空间为数据组织架构, 以 5维时空打标(X·Y·Z·T·S)为质量管理基准,以 垂直领域专用模型池(ACT / VLA-T / zFlow / GR00T / ThinkAct)为核心推理引擎, 形成 条件编码 → 模型路由 → 动作执行 → 数据回灌 → 模型更新 的完整闭环。

核心理念:垂直领域专用模型池

1.1 设计决策:拒绝通用,拥抱垂域

当前具身智能行业存在两条泾渭分明的技术路线。第一条路线追求「万能通用智能体」——训练一个超大参数模型,试图覆盖从感知、推理到执行的全场景需求,以参数规模换取泛化能力。第二条路线则先训练具备基础世界认知能力的模型,再针对具体场景进行后训练,将其转化为垂类场景专家,以场景深度换取确定性和可靠性。

Z-MAX 坚定选择后者。全局数据空间以 DDS 为数据总线,以 UNS 统一命名空间为数据组织架构,以 5 维时空打标(X·Y·Z·T·S)为数据质量管理基准,以 垂直领域专用模型池(ACT / VLA-T / zFlow / GR00T / ThinkAct)为核心推理引擎,以 原子技能 + 残差 RL为动作执行框架,形成条件编码 → 模型路由 → 动作执行 → 数据回灌 → 模型更新的完整闭环,最终实现从 95% 到 99% 成功率的持续进化。这一决策的根因在于工业场景对确定性、可靠性和低延迟的刚性要求——产线上的每一次抓取、每一次插入、每一次检测都不容许概率性的「差不多」。

行业趋势验证

杭叉集团已发布面向精细感知和复杂作业的物流垂直领域具身智能模型 LogiMind,聚焦仓储物流场景的深度优化。
埃斯顿探索「垂类模型 + 机器人」模式,2025年工业机器人出货量超 3.5 万台套,验证了垂域模型与硬件深度绑定的商业化可行性。
Z-MAX 的垂域模型池策略与行业先行者的方向一致,但更进一步——不是做一个垂域大模型,而是做五个互补的垂域小模型,每个模型只解决一类问题,组合起来覆盖全产线。

1.2 架构设计分析:为什么是模型池而非大模型

确定性优先

54 条件场景 → 精确映射

通用大模型面对同一输入可能产生不同输出(概率采样),工业场景不可接受。模型池中每个模型只处理其擅长的条件子集,输出确定、可复现。

延迟可控

模型参数与计算量解耦

通用大模型推理延迟受参数规模制约(7B参数需~280ms)。模型池中 ACT(~10M) 和 zFlow(~18M) 可在 Orin Nano 上实现 <5ms 推理,满足力控闭环 >1kHz 的实时性要求。

迭代独立

单模型更新不牵动全系统

通用大模型微调可能造成灾难性遗忘。模型池中每个模型独立训练、独立部署、独立回滚。VLA-T 的力控策略升级不影响 GR00T 的光口插拔能力。

数据效率

500 样本 → 95%,5000 样本 → 98%

垂域模型训练所需数据量远小于通用大模型。结合数据回流机制和智能标注,模型池可以在真实产线数据上持续进化,无需海量预训练语料。

1.3 全局数据空间的战略定位

全局数据空间(DDS Global Data Space)是模型池策略的使能层。它不是一个数据库或消息队列,而是一套以数据为中心的分布式架构——所有传感器、编码器、模型、执行器和反馈通道都在同一个命名空间下读写数据,彼此不关心对方的物理位置或编程语言。

在这个架构中,数据质量管理不是事后补救,而是嵌入全链路的原生能力:从传感器采集的那一刻起,每一帧图像、每一组力觉读数、每一次动作指令都被打上 5 维时空标签(X·Y·Z·T·S),在数据空间中形成可追溯、可检索、可回流训练的完整证据链。这正是 Z-MAX 与「端到端黑箱推理」路线的本质差异——我们不仅要智能,更要可解释、可审计、可进化的智能

54条件场景
精确映射
5垂域模型
各司其职
242原子技能
可组合复用
48原子动作
RL持续进化
4款机器人
协同执行

5维时空数据打标方案

2.1 五维定义

维度定义数据表达质量目标
X·Y·Z工位空间坐标每台机器人/工位的物理位置±0.05mm
T时间轴采集时刻、动作时间戳、同步时钟<1ms 同步
S语义层感知 · 特征 · 条件 · 动作 · 反馈 五层全链路可追溯

2.2 UNS 统一命名空间

UNS(Unified Namespace)以一致且标准化的方式组织实时工业数据,核心目标是消除数据孤岛。

zmax://
├── /sensors/ # 传感器层
│ ├── /vision/ # 视觉 (RGB-D / 显微镜 / 端面) │ ├── /force/ # 六维力 (Fx/Fy/Fz/Mx/My/Mz) │ ├── /tactile/ # 触觉 (压力分布 / 接触状态) │ └── /joint/ # 关节状态 (角度/速度/扭矩)
├── /conditions/ # 条件层 (54种条件场景)
│ ├── /c001/ # 100G取料·视觉定位 │ ├── /c004/ # 400G插入·六维力控 │ └── /c039/ # 透镜对准·亚微米耦合
├── /skills/ # 原子技能层 (242条) ├── /actions/ # 动作层 (48种原子动作) └── /feedback/ # 反馈层 (成功记录 / 失败记录+力曲线)

2.3 原子技能 → 5维打标(5步法)

步骤维度打标内容示例:P004「缺陷识别」
第1步S=sensor传感器类型 + 工位坐标高分辨率相机@I-103 / 显微镜@I-103
第2步S=feature提取的特征缺陷边缘检测 / 异物颗粒计数
第3步S=condition判断条件漏检率<0.5% · 误判率<1%
第4步S=action执行动作IDA008:AOI缺陷检测 · 3D识别 · 分级
第5步S=feedback反馈标准检出率>99.7% · 漏检率<0.3%
数据质量管理体系:覆盖动态数据质量管理 + 垂类数据合成 + 智能标注。仅需 500 个有效样本即可达到 95% 以上准确率,5000 个样本可提升至 98% 以上。建立数据回流机制,挖掘已标未标数据价值。

条件编码与分发策略

3.1 DDS — 技术底座

DDS 不仅是「发布-订阅」消息传递,更是一块全局共享白板:所有节点都能发布或读取数据,不关心对方在哪台机器、用什么语言。以数据为中心,提供丰富的 QoS 策略保障实时、高效、灵活分发。

3.2 条件编码器 — 54 场景 → 向量

视觉特征SigLIP/DINOv2
→768维
+
力觉特征MLP(6→128)
六维力
+
触觉特征ResNet
→128维
+
MES信号Sentence-BERT
→256维
Cross-Attention多模态融合
256维条件向量

3.3 DDS Lookup — 条件→模型路由表

条件ID场景描述→ 垂直领域专用模型→ 动作延迟推理层
C001100G取料·视觉定位ACT 动作分块A01取料<5msSys1·Orin
C004400G插入·六维力控VLA-T 力控VLA ⭐A04插入<5msSys1·Orin
C014400G光口·力控插拔GR00T N1.7A22-A25~280msSys2·4090
C039透镜对准·亚微米耦合zFlow H-JEPA<5msSys1·Orin
C047多模态异常检测ThinkAct 反思修正S01-S04<10msSys2·4090

3.4 StageACT 阶段条件编码器:从"开门"到"通用数据质量管理"

StageACT 提出了阶段条件化模仿学习框架——将长时域任务分解为离散阶段(S1 接近把手→S2 抓握→S3 转动→S4 拉开→S5 通过),底层策略以 One-hot 阶段向量为条件输入。核心洞见:同一观测在不同阶段有完全不同的最优动作——机器人看到门把手时,是伸手还是拉回,取决于当前处于哪个阶段。这一机制天然解决了观测歧义,并赋予了策略在失败时自主回退到正确阶段的恢复能力。

Z-MAX 将 StageACT 的阶段条件化思想深度集成到 DDS 数据质量管理体系中,形成三级条件编码架构:① VLM 高层阶段识别(视觉语言模型自动标注当前任务阶段)→ ② 条件编码器中层映射(阶段标签 → 256维条件向量 → 模型路由)→ ③ 底层策略阶段条件化执行(每个垂域模型接收阶段条件,在正确的时间执行正确的动作)。这不仅是一种模仿学习技巧,更是一套通用任务结构化 + 质量可追溯 + 模型可演进的数据驱动范式。

VLM 阶段识别视觉语言模型
自动标注S1~S5
阶段条件编码One-hot→256维
Cross-Attention融合
DDS Lookup 路由条件→模型池
5模型择1
阶段条件化策略底层策略+阶段输入
自主恢复+乱序执行
闭环数据回灌成功/失败轨迹
→VLM标注更新

▲ 三级条件编码架构:从 VLM 语义理解到底层策略阶段条件化执行的全链路

三大技术支柱

① 子轨迹共享

任务的"乐高化"分解

不同任务之间存在大量可复用的子轨迹和任务片段。例如"接近目标"(S1)在开门、开抽屉、抓取零件时几乎完全一致。将这些基础动作片段抽离为共享的阶段模板,新任务只需组合已有阶段即可快速学习,极大降低数据采集成本。DDS 原子技能体系(242条)正是这一思想的落地——每个子轨迹就是一个可检索、可复用的标准化数据单元。

② VLM 自动阶段标注

大模型充当"高层分类器"

StageACT 论文明确指出未来将使用视觉语言模型(VLM)在训练期间自动标注阶段,并最终在测试时作为高层分类器。Z-MAX 的落地路径:VLM 观察产线摄像头 → 识别当前工序阶段("正在贴片""正在打线""正在目检")→ 自动生成 One-hot 阶段标签 → 注入条件编码器。这彻底解决了人工标注阶段的瓶颈,形成"VLM 大脑 + 阶段条件化策略小脑"的分层智能架构。

③ 阶段条件化泛化

从"推门"到"拉门",从一种门到万种门

StageACT 的实验证明:阶段条件化框架与具体物理形态解耦。只要将任务合理拆解为阶段,无论是推门/拉门、左铰链/右铰链,都能用同一套逻辑解决。Z-MAX 将此推广到产线场景:"取料"阶段在 100G 光模块和 400G 光模块上是同一套阶段模板,只需微调传感器参数和力控阈值。这正是 DDS 54 条件场景可覆盖数百种实际工况的根本原因。

StageACT 阶段 → 800G DR8 产线条件编码映射

StageACT 阶段产线工序映射(800G DR8)典型工位示例→ 条件编码策略→ 模型路由
S1 上料定位 物料进入工位 · 视觉定位与识别 I-101 拆包上料 · I-102 扫码绑定 视觉特征(D405 RGB-D)+ 空间坐标编码(X·Y·Z)+ MES料号验证 ACT 视觉伺服定位
S2 取放对准 夹爪/吸嘴抓取工件 · 精确定位到目标工装 I-111 DA贴片取料 · I-121 固晶点胶对准 力觉特征(六维力MLP: Fx/Fy/Fz/Mx/My/Mz)+ 触觉确认(真空吸附/夹持力) VLA-T 力位混合控制
S3 核心工艺 DA贴片 · WB金线键合 · 透镜耦合 · 等离子清洗 · UV固化 I-112 DA贴片(±5μm)· I-122 金线键合 · I-131 自动耦合(亚微米) 力控曲线(接触检测→恒力保持→释放检测)+ 关节状态(7轴角度/速度/扭矩)+ MES工艺参数 VLA-T 精密力控 / zFlow 亚微米对准
S4 工序流转 工位间物料传递 · 料盘/料箱/托盘转运 · 老化箱进出 I-141 贴片→打线流转 · I-151 烘烤上下料 · I-161 BI老化箱 视觉跟踪(多相机接力)+ 安全信号(区域光栅/急停)+ 碰撞检测(力阈值监控) ACT 搬运轨迹 / Z100L 轮式双臂
S5 质量门禁 AOI外观检测 · 端面检测 · OE测试 · 数据回灌训练 I-171 AOI检测 · I-181 端面清洁+检测 · I-191 OE出货检查 AOI视觉检测结果(缺陷分类+位置)+ 力曲线分析(全程力控合规率)+ 节拍记录(各阶段耗时) ThinkAct 反思判定+数据回灌
StageACT 对 800G DR8 产线数据质量管理的核心启示

800G DR8 光模块产线涵盖 COC · OE · MOD · WH 四区 128 个工位,传统方案将每个工位的完整工序视为一个整体——数据质量无法按阶段追溯,DA贴片失败和WB打线失败在数据回流中混为一谈。StageACT 的阶段条件化方案为此提供了精确解法:将每个工位的生产流程拆解为 S1~S5 五个阶段,每个阶段拥有独立的质量判定标准和恢复策略

以 I-121 固晶点胶工位为例,传统方案只能记录"点胶成功/失败"。引入阶段条件化后,数据回流变为:S1 上料定位(视觉定位偏差 0.05mm · 合格)→ S2 取放对准(夹持力 2.3N · 真空度 -85kPa · 合格)→ S3 核心工艺(点胶压力曲线偏差 +12% · ⚠️警告)→ S4 工序流转(未触发)→ S5 质量门禁(AOI胶量检测 · 合格)。如果 S3 阶段持续偏离,系统自动将该阶段标记为"待RL微调",仅针对点胶压力控制策略进行强化学习,而不影响 S1/S2/S4/S5 的稳定策略。这正是数据质量从粗到细的范式升级的核心价值。

数据质量范式升级:工位级(I-121 成功率 97.3%) → 阶段级(S1:99.8% · S2:99.2% · S3:94.1%⚠️ · S4:99.5% · S5:98.7%) → 帧级(每帧传感器数据 + 阶段条件编码 + 质量门禁判定)

3.5 垂直领域专用模型池

模型参数量定位适用场景技术来源
ACT~10M动作分块取料·扫码·放置CoRL 2023
VLA-T~450M力控VLA ⭐ 核心主力力控插拔·精密力位混合自研VTLA
zFlow H-JEPA~18M预测编码·潜空间透镜对准·自主安全检测H-JEPA架构
GR00T N1.7~1.7B云端训练·大参数推理复杂光口插拔·多工位联动NVIDIA
ThinkAct~7B反思修正·长程规划异常检测·自主纠错NVIDIA双系统架构

强化学习与条件编码的闭环

4.1 闭环架构

条件编码54条件
→向量
模型推理垂域模型
5选1
动作执行48动作
4机器人
结果采集成功/失败
力曲线
条件编码更新映射
策略更新策略梯度
残差RL
奖励计算4维奖励
加权求和
结果采集

4.2 奖励函数设计

奖励 = 条件匹配 + 动作精度 + 力控安全 + 节拍效率

奖励分量计算方式权重
条件匹配当前条件与预测条件的余弦相似度0.3
动作精度末端位姿与目标位姿的负欧氏距离0.3
力控安全-|实际力 - 目标力| / 力阈值0.2
节拍效率- 实际耗时 / 目标节拍0.2

4.3 三层技能架构

Z-MAX 三层技能架构
高层:任务规划器~50种 · VLM推理+LLM规划ThinkAct 双系统
中层:技能组合器~242条 · 条件编码+RL调度AtomSkill 框架
底层:原子动作~48种 · RL训练+残差RL修正SCALAR 双向闭环

4.4 闭环反馈数据流

反馈类型数据内容用途
成功轨迹完整动作序列 + 传感器数据扩充训练集 · 行为克隆
失败轨迹失败点 + 力曲线 + 视觉图像困难样本挖掘 · 长尾增强
力控曲线六维力时序数据力控策略优化
节拍数据各步骤耗时效率优化 · 瓶颈识别

数据质量门禁与持续进化

🚪 采集门禁

单次采集 ≥300 帧

传感器数据完整性检查。不达标 → 重新采集

🚪 标注门禁

标注一致性 ≥95%

质检抽样通过。不达标 → 退回重标

🚪 训练门禁

分布偏移不显著

训练集 vs 验证集一致性。不达标 → 扩充数据

🚪 部署门禁

新模型 ≥ 当前成功率

验证集 A/B 对比。不达标 → 拒绝部署

Orin 采集MCAP/npz
MAC 转发HTTP心跳
4090 训练H-JEPA/GR00T
模型部署Sys1/Sys2
DDS 映射更新持续迭代

完整技术方案汇总

Z-MAX 全局数据空间 · 五层技术架构
① 数据打标层5维时空数据空间 (X·Y·Z·T·S)UNS命名空间 + 智能标注 + 数据回流
② 条件编码层54条件 → 256维条件向量SigLIP + 力觉MLP + 触觉ResNet + Cross-Attn
③ 模型路由层DDS Lookup → 垂直领域专用模型池ACT / VLA-T / zFlow / GR00T / ThinkAct
④ 动作执行层48原子动作 → 4款机器人AtomSkill + 残差RL + SCALAR闭环
⑤ 闭环反馈层执行结果 → 训练数据 → 模型更新内生蒸馏(RLDG) + 在线RL微调 → 95%→99%
54条件场景
5垂域模型
242原子技能
48原子动作
4款机器人
<5ms边缘推理延迟

策略总结

一条主线:条件驱动 · 数据闭环 · 持续进化

两个引擎:左侧控制流程(条件→模型→动作)+ 右侧质量监督(门禁→验证→回灌)

三个层级:系统0(执行·Orin Nano)→ 系统1(推理·4060)→ 系统2(训练·4090)

四个核心:54条件 + 5模型 + 48动作 + 4机器人

五个维度:X·Y·Z 空间 + T 时间 + S 语义(感知/特征/条件/动作/反馈)

六步闭环:采集 → 标注 → 训练 → 部署 → 执行 → 回灌

垂直领域专用模型池 · 5维时空打标 · 条件编码分发 · 强化学习闭环
目标:从 95% 到 99% 成功率的持续进化

Z-MAX 静界科技 · 全局数据空间数据质量管理策略