Z-MAX 状态空间(State Space)是一套借鉴人脑认知神经机制研发的类脑隐空间预测世界模型,面向光模块精密制造场景,在低数据依赖前提下实现高精度、高泛化、高一致的精密操作能力。与具脑磐石 Cog-WM 1.0 的路线一致——它关注的不是「像素怎么变」,而是「与任务有关的状态怎么变」,并据此预测下一步动作。
在产线上完成一次光模块插拔(接近→对位→抓取→转移→插入→拔出→AOI→放回),机器人要面对与「陌生房间寻物」「连续物品整理」同源的三组结构性挑战:
| 问题 | 状态空间的回答 |
|---|---|
| ① 如何降低对海量任务数据的依赖? | 在隐空间而非像素层面重建世界:把多源观测编码为 43D 统一状态向量(39D 视觉 + 4D 触觉),只预测对决策有用的抽象表征,学习目标小了,数据需求自然小。 |
| ② 如何让历史信息真正被用起来? | 时空记忆内容与结构分离:八阶段状态机固化「插拔任务大概长什么样」,换料盘/换批次不需要重新学;先验动力学预测器对「下一步会怎样」做前瞻,历史帧拼接进当前观测。 |
| ③ 如何提高长程任务的完成度? | 隐空间多层级预测 + 分级回退:L4 档失败不放弃,靠状态校正器残差闭环与「恢复执行体」自主重试,直至完成或物理死局。 |
这三问,本质是范式层面的结构问题——把数据扩大十倍、参数扩大十倍,并不能自动换来物理世界的认知理解与真实交互能力。状态空间的答案与 Cog-WM 1.0 相同:回到智能的本源——人脑。
状态空间的底层思路,是借鉴人脑认知地图组织记忆、选择性更新信息、预测后续状态的机制,与JEPA(联合嵌入预测架构)结合,在模型提取的抽象特征空间里学习「未来会怎么变」,并据此支持动作。支撑这一思路的是三套成体系、可归因的机制:
| 类脑机制 | 状态空间实现 | 工程落地 |
|---|---|---|
| 感知编码与目标调控 隐空间而非像素层面重建世界 | 43D 统一状态向量:39D 视觉(hand/peg/hole 目标位姿 + 几何段位)+ 4D 触觉(grasp/contact 夹持与接触标志) | fuse_sensors 多源观测融合,观测方程编码单一状态向量 |
| 时空记忆内容与结构分离 任务结构跨批次复用 | 八阶段状态机(接近→对位→下降→抓取→抬起→转移→插入→完成),结构可复用、参数可标定 | 动作调制器按阶段调度 + 阶段限速 + 夹持丢失回退 |
| 隐空间多层级预测 跨时空尺度分层预测 | 三层预测架构:前馈加速器(快路径 MLP,obs→u_ff 无递归)‖ 自适应状态估计器(递归 GRU 潜状态 + 卡尔曼 predict/update)→ 先验预测 → 状态校正 | S1 感知 → S2 并行预测 → S3 决策 → 执行层卡尔曼闭环 |
| 惊异更新 只对「意外」投入学习 | 状态校正器残差闭环:r = z − x̂₋(观测 − 先验预测),卡尔曼增益 K 门控「信预测 vs 信观测」,残差超阈值触发异常告警 | 接触概率 σ(残差·gain),异常诊断四分类 |
| 价值引导经验学习 按任务推进贡献调策略 | 性能流形对准代价:V = ½‖e‖²(李雅普诺夫代价),耦合效率 η = exp(−V/σ²)(高斯光束近似) | 流形导航 + 完成态判定 + 性能退化监测 |
说明:此处的「类脑对应」是机制层面的启发,而非生物同构。核心在可归因性——每一层能力提升都对应一个明确机制,而非打补丁式优化。
状态空间按能力档位模块化为三档(L2/L3/L4),通过控制任务链深度实现按场景分级——从单段插装到完整作业链再到专家自主恢复,一档一深度。三档共享同一状态空间底座,一键切换无需改代码。
技术载体:YOLO 目标检测 + 前馈 MLP + 13 段状态机 + 原子技能库 + 安全限幅。分级定义:分段技能辅助(人在环 / 保底执行),类比「车道保持 + ACC」——系统辅助单段,驾驶员监控。
| 编号 | 功能 | 说明 |
|---|---|---|
| L2-A01 | 目标检测 | YOLO 检测光模块/插孔/末端(真实模型推理,每帧) |
| L2-A02 | 2D→3D 解算 | 检测框反投影 3D 位姿(真实深度模型) |
| L2-A03 | 触觉感知 | 力/触觉通道 → 接触感知 |
| L2-A04 | 状态融合 | 多传感融合 → 43D 统一状态向量 |
| L2-A05 | 前馈建议 | 左脑 MLP 前馈 u_ff(蒸馏权重真推理,域内) |
| L2-A06 | 状态机调度·13 段 | 13 段状态机(插→拔→AOI→回放)逐段推进,insert/full 双模式 |
| L2-A07 | 安全边界 | 饱和限幅/否决/力保护,三层安全不越界 |
| L2-A08 | 原子技能 | SK01-08 固定模板快速执行 |
| L2-A09 | 插拔工艺 | 拔出两段式(沿孔轴拉出→抬离) |
| L2-A10 | AOI 检测流程 | 镜头对焦保持 + 检测报告(真实 PASS/FAIL) |
| L2-A11 | 物理执行 | 执行器 → 物理世界闭环(metaworld 真实物理) |
技术载体:SmolVLM 通用视觉编码 + Flow-Matching DiT ActionHead(smolvla_lew)。分级定义:端到端 VLM + DiT(域内自主,出域交还 L2),类比「高速 NOA」——特定场景自主。
| 编号 | 功能 | 说明 |
|---|---|---|
| L3-B01 | 通用视觉编码 | VLM 场景目标识别 → 潜空间 z(真实权重接入点 = smolvla_lew) |
| L3-B02 | 任务规划 | 任务指令 → 技能序列(规则 + LLM 可插拔) |
| L3-B03 | 动作头解码 | DiT 解码 z → action 块(真实 DiT 权重 = smolvla_lew 接入点) |
| L3-B04 | 双通路执行 | DiT action 双下行:执行端直通 + 前馈层肌肉记忆固化 |
| L3-B05 | 端到端演示 | 端到端自主演示链(仿真链已通,真权重接管后验收) |
技术载体:潜空间预测 / 流形导航 / 标定 / 自主恢复 / 肌肉记忆(右脑,辅助非决策)。分级定义:世界模型技术(复杂场景全自主 + 恢复,无需人在环),类比「城区 NOA + 自主恢复」。
| 编号 | 功能 | 说明 |
|---|---|---|
| L4-C01 | 状态估计 | 自适应状态估计器(潜状态跟踪,卡尔曼 predict/update) |
| L4-C02 | 先验预测 | 先验动力学预测 next_obs(右脑 WM 真权重) |
| L4-C03 | 接触流形导航 | 接触流形 e∥/e⊥ 分解 + 风险(插拔安全通道) |
| L4-C04 | 性能流形导航 | 性能流形 V/η 对准代价(光耦合效率) |
| L4-C05 | 潜空-流形标定 | 潜空间/世界模型流形标定(维度/速度场 prior_A) |
| L4-C06 | 校正恢复 | 状态校正器残差闭环 + 滑脱重抓/遇阻分级重试 |
| L4-C07 | 肌肉记忆 | 标杆模板固化 → 前馈快通道(越练越顺,引擎级小脑机制) |
| L4-C08 | 真实化运行 | R1 视觉闭环(逐帧 YOLO 真感知 + 真实化断言组) |
| L4-C09 | 抗干扰作业 | 来料外力干扰注入(移位±3.5cm/转向±15°)+ 转台水平旋转 90°(夹爪绕 z 回正) |
| L4-C10 | 流形预测器 | JEPA 世界模型预测流形(z+a→z'→流形6D),v1→v5(CY 等距正则修复) |
| L4-C11 | 记忆分层·BLMA | 三层记忆带(小脑肌肉/海马情景/额叶筹划)+ 总装记忆中枢 |
| L4-C12 | 光耦合精密操作 | 真空治具吸附 + 压电 x/y 微动伺服(±2mm)使 δ→0,η=exp(−δ²/2σ²) 收敛 |
状态空间与 Cog-WM 1.0 共享同一套「类脑隐空间预测」范式,但在任务域上各有侧重:Cog-WM 1.0 覆盖导航(Navigation)+ 操作(Manipulation),Z-MAX 状态空间专攻精密操作(精密插拔 + 光耦合)。机制逐条对照:
| 类脑机制(Cog-WM 1.0) | Z-MAX 状态空间对应 | 可归因证据 |
|---|---|---|
| 感知编码与目标调控 | 43D 统一状态向量 + 目标段位映射 | 观测方程编码单一向量,字段可追溯到编码器/视觉/触觉 |
| 时空记忆内容与结构分离 | 八阶段状态机 + 潜空间速度场(A=1.0 物理自洽) | 任务结构跨批次复用,换料盘不重训 |
| 隐空间多层级预测 | 前馈(快)‖ 估计器(递归)→ 先验预测 → 状态校正 | S1/S2/S3 三层,卡尔曼闭环 |
| JEPA 联合嵌入预测 | 先验动力学预测器 x̂₋ = A·x + B·u | 观测前先猜,残差作基准 |
| 惊异更新 | 状态校正器 r = z − x̂₋,残差超阈值告警 | 接触概率 σ(残差·gain),异常四分类诊断 |
| 价值引导经验学习 | 性能流形 η = exp(−V/σ²) 对准代价 | 流形导航 + 完成态判定 |
状态空间坚持「真实执行 + 数值证据」的验收红线——每个结论都带实测数字可复核,不接受写死/伪装:
| 指标 | 实测值 | 说明 |
|---|---|---|
| 八阶段插拔全链 | 插入完成 6.42s · 305 步 | 接近→对位→抓取→转移→插入→完成顺序全出现 |
| 接触概率峰值 | 1.00(39 帧 contact_p>0.6) | 接触力 → 接触概率联动 |
| 收敛精度 | 终态销头−孔底 3.08mm < 4mm | D_INSERT 判据 |
| 一阶速度伺服 | max‖v‖ = 0.211 m/s ≤ 0.5 | 轨迹契约有界 |
| 光耦合 η | 0.89 → 1.0000(6 轮压电微动) | 性能流形收敛报告 |
| L4 流形预测器 v5 | 抗干扰 64.6% / clean 43.3% | CY 等距正则修复版(detach bug 消融实锤) |
| 泛化提升 | 16.4% → 39%(v2 → v3) | JEPA 流形预测器 867K 参数 + 分维加权损失 |
| L4 抗干扰演示 | 90° 外力旋转 + 夹爪绕 z 回正(全真物理链路实测) | 转台干扰 + 治具校直 + 光耦合 η |
与具脑磐石 Cog-WM 1.0 的判断一致:具身智能能力的突破,仅靠堆砌海量数据是不够的,更应该系统借鉴人脑心智模型,改进算法模型的结构与架构。状态空间把这条路线落到了光模块精密制造这一最苛刻的垂直场景——金手指零划痕、微米级光耦合、7×24 无人化值守——当机器人不再「读死轨迹」,而是像人一样「在隐空间里预测下一步」并「长记性」,精密操作才真正开始。
「低数据、高泛化」不是口号,是 L2 的 11 项基础功能、L3 的 5 项端到端能力、L4 的 12 项世界模型机制,逐层叠加出来的、可逐条归因的工程现实。