机器人双手迎来全栈训练系统:灵初智能EgoSteer让灵巧手无所不能 记得何同学做过一个超复杂的流水线项目吗内容来源老师好我叫何同学这个视频发布于 2024 年 1 月当时要实现自动叠纸盒把礼物放进纸盒的自动化操作正是这样一个机械臂和自动化编程组合成的流水线。如果有一个能像人一样灵活的机器手来折叠包装长时间批量地工作何同学团队耗费心力打造的庞大流水线的功能就能够被两个小体积的灵巧手给完美实现。并且也不需要考虑各种流水线上的稳定性灵巧手自己就能够解决遇到的位置偏移变形等问题全面自主。相比复杂的机械臂和自动化灵巧手的自由度和泛用性显然是其不可比拟的。这很难但和人类双手接近的灵巧手已经出现了。这一对双臂灵巧手在精细操作、长程任务和泛化性上均展现出了亮眼的成绩而它来自于灵初智能。在这两个灵巧手准确协同实现精巧操作的背后是一套灵初智能与北大 - 灵初联合实验室共同发布并开源的技术范式称为 EgoSteer是一套双灵巧手通用操作大模型和全栈系统。论文链接https://egosteer.github.io/EgoSteer.pdf项目主页https://egosteer.github.io/#/到目前为止业界能跟随自由语言指令、还能在全新场景里泛化的模型少之又少。π0.7、DreamZero 这些近期在通用性上取得突破的工作把机器人能干的活儿从「一个任务」推到了「一批任务」但它们大多依赖昂贵的真机数据。但我们知道具身灵巧手最好的数据必然来自人类的双手。EgoSteer 是一个里程碑式的进步。它能跟随开放式的自然语言指令完成一百多种语义各异的灵巧操作任务还能用少量示范快速学会复杂的长程任务。该全栈系统已完整开源代码、模型权重数据也将近期开源为双灵巧手通用操作开究提供了一套高质量、可复现、可迭代的全栈基线。数据模型和系统深度技术拆解下面我们从三个层面把它拆开数据、模型和系统闭环。这三块拼在一起才能真正被称为「全栈」系统。近万小时人手视频变成训练数据先说一个反直觉的事实制约灵巧手大模型的瓶颈往往落在数据上。但数据本身其实并不稀缺稀缺的是能拿来训练的数据。第一人称人类视频也就是戴着相机以人的视角拍下的操作画面是天然的富矿。全网这类可用素材大约有 11.6 万小时人手在里面拧、捏、递、叠蕴含着海量的交互知识。问题在于这些视频原始状态下噪声大得惊人镜头剧烈晃动、双手频繁被遮挡、既没有可靠的语言标注也没有精确的动作标注。直接拿去训练模型学到的是一堆彼此矛盾的监督信号下游策略只会被带偏。灵初把处理这些视频的管线单独做成了一个系统叫 EgoSmith。它是一条四阶段的全自动流水线目标是把视频变成带精细语言和动作标注的可训练数据。EgoSmith 概览EgoSmith 能够将噪声较大的第一视角视频整理为高质量的灵巧操作 VLA 数据为语言驱动的机器人预训练提供可规模化的人手交互先验。第一阶段是预过滤。用简单但有效的启发式规则先做一遍粗筛在 128 个采样点的网格上算平均光流光流大的往往对应人在走动、并没有在操作直接丢掉再用 YOLO 检测画面里手的数量、尺度和位置靠几何规则剔除严重遮挡或有旁人乱入的帧只留下手部操作清晰可见的片段。第二阶段是 4D 运动估计把头和手的运动还原到真实物理空间里。EgoSmith 用更轻更稳的 DPVO 做相机跟踪和关键帧深度用 Any4D 做逐帧的度量尺度深度预测两者对齐尺度比之后恢复出更准确的相机轨迹再把相机坐标系下的手部运动转换到统一的世界坐标系。第三阶段是多层级语言标注这是「听懂人话」的基础。先用 Qwen3.5-VL-Plus 把那些没有实质手物交互的片段再滤掉一批剩下的每一段都生成从粗到细的五级语言指令L1 是动词加宾语这样的原子指令L2 是要点摘要L3 以物体为中心L4 以手为中心区分左右手分工L5 则细到分步动作。第四阶段是后过滤做多级质量控制。episode 级看相机平移分布剔除离群、用硬阈值丢掉头部运动过大的片段chunk 级把手腕姿态转到中间帧、把手指关键点投影到逐帧手腕系剔除坐标空间的离群值frame 级算相机、手腕、手指的帧间差分用硬阈值滤掉突变跳变。一层层筛下来那些因为三维重建漂移、尺度不准、跳帧而变得不可靠的片段被系统性地清除。最终产出是一个标准化的数据集横跨 12 个开源数据集9.6K 小时、209 万个片段、10.4 亿帧覆盖 8969 个不同的物体名词和 623 个动作动词。让 VLA 学会「想象」只在训练时出现的世界模型有了干净的数据接下来就是最重要的训练模型环节。EgoSteer 的模型本体是一个基于流匹配flow matching的 VLA但它最有意思的设计是给这个 VLA 挂了一个世界模型专家而这个专家只在训练时存在推理时直接丢掉不带来任何额外的计算负担。EgoSteer 概览一种结合世界模型增强的 VLA 模型用于实现可控的灵巧操作。要理解这个设计的巧思得先看清模型的骨架。EgoSteer 由三部分组成共享一个视觉语言主干第一部分是主干用的是预训练视觉语言模型 Qwen3-VL2B 规模采用因果注意力负责把图像、语言、状态这些多模态输入编码成表示。第二部分是动作专家一个基于 DiT 的模块约 3 亿参数通过流匹配来生成动作块action chunk。它采用联合注意力既看自己也看主干的表示。第三部分是世界模型专家一个轻量的 4 层 Transformer约 7000 万参数。它干的事听起来有点抽象给定当前要执行的动作和相应的相机运动去预测未来那一帧画面的 DINOv3 特征。为什么要预测未来团队的洞察是VLA 天生擅长视觉和语言的理解却缺乏对「下一秒会发生什么」的想象而这种想象的缺失恰恰限制了动作生成的精度。世界模型专家正是在这一环节进行补强。训练时它拿真实动作、相对相机运动和一串可学习的查询 token 作为输入去回归未来帧经 DINOv3 编码后的语义特征。这里有两个值得说的细节。一是它选择回归 DINOv3 特征而放弃直接预测像素因为语义特征天然过滤掉了光照变化和背景噪声比在像素空间里预测图像提供的梯度更稳定、更直接。二是这个专家只有 4 层且以固定间隔去注意主干的层。它存在的价值是让「预测未来」这个目标产生的梯度回流到主干主干对世界的理解变强了动作专家的精度自然跟着水涨船高。到了推理阶段这个专家功成身退一点推理开销都不留。EgoSteer 用一套统一的动作空间手腕位姿用 3D 位置加 6D 旋转表示手部姿态用五根手指指尖在手腕坐标系下的位置表示双臂双手加起来是 48 维。人手数据和机器人数据被强行拉到同一种表示格式下。人类操作的宝贵数据就是通过这套统一表示平滑地流向机器人。最后一个工程细节关乎「流畅」。机器人真机推理时如果每生成一个动作块就停顿一下等下一次推理动作会一顿一顿的。为此 EgoSteer 采用了训练时的 Real-Time ChunkingRTC技术训练时喂给模型一段干净的、带随机延迟的动作前缀作为已知条件只让它去噪后续动作以覆盖推理延迟。人在闭环「无缝接管」失败机器人数据和模型之外全栈系统的第三块是机器人系统 Robot-Stack。它把遥操作数据采集、模型推理部署、人在闭环纠偏这三件事融进了同一套底层控制里。这套设计的第一层价值是一致性。无论机器人是在自主跑模型还是人戴着数据手套在手动遥操作底层共用完全相同的控制环路和 FK/IK 计算逻辑跑在同一批 ROS2 节点上。真正精彩的是「人在闭环纠偏」的接管机制。想象一个场景机器人在执行任务眼看要失败了一位专家需要立刻接管。这个接管的瞬间是个大坑如果直接把人手的绝对姿态映射到机器人上机器人的状态会在交接的一刹那突变物理上就是一个剧烈的抖动轻则任务失败重则损坏器件。灵初的解法非常巧妙称之为「相对动作映射」。操作员踩下脚踏板发出接管信号的那一刻系统记录下机器人当前的末端姿态和人手当前的姿态作为各自的基准。此后系统只把操作员手部的相对运动量叠加到机器人的当前状态上。直观地说操作员只要顺着机器人当下的姿势去比划就能平滑地接过控制权全程没有突变抖动。纠正完成后再踩一次脚踏板控制权无缝交还给模型。接管成功率超过 85%。这套机制的妙处在于它让在线纠偏的数据收集变得极其低门槛。专家可以在机器人失败的任意状态下丝滑接管、示范正确做法而且只有这些「介入片段」会被留下来作为纠偏训练数据。灵初用三轮 DAgger 迭代在 56 个任务上一共只采集了 3.7K 条轨迹、8.3 小时的纠正数据。靠这套控制栈团队以极低的人力成本采集了覆盖 193 个桌面操作任务、187 小时的高质量真机数据涵盖从简单抓放到非抓握、重定向、双手协作、接触密集等 7 大类操作。把数据、模型、系统三块串起来EgoSteer 的训练遵循三个阶段。第一阶段用 9.6K 小时的人类第一人称数据做预训练只用头部相机在 128 张 A800 上训了 175K 步、约 164 小时。第二阶段用 187 小时多样化的真机数据做后训练加上胸部相机形成双视角学习率降到原来的十分之一。第三阶段是多轮人在闭环 DAgger 纠偏。实验结果EgoSteer 的评测拆成了几个彼此独立的维度每一个都在回答一个具体的疑问它到底能不能听懂话、能不能应付没见过的场景、那些精巧的模块是不是真的有用、近万小时人手数据最终换来了什么。可操控性与泛化EgoSteer 全程只用一个共享模型不为任何单一任务做专门微调所有动作都由开放式的自由语言指令直接驱动。评测覆盖 7 大类操作从简单抓放PnP到非抓握推拨、物体重定向、双手协作、接触密集型任务一共 40 个日常复杂任务每个任务在随机杂乱的场景里试验 10 次。最终的整体平均成功率是 75%。EgoSteer 在涵盖 7 个类别的 40 项任务中的可控操作性能。它能够稳健地遵循自由形式的语言指令完成任务实现总体 75% 的成功率展现出良好的泛化能力。EgoSteer 把评测任务切成了三档难度。第一档是训练时见过的任务模型表现稳定。第二档是组合泛化指令把已知技能重新拼装这类需要理解指令结构、重新编排子技能的任务成功率 65%。第三档最难是语义上完全没见过的新任务成功率 62%。一个模型在没见过的语义任务上还能保住六成的成功率说明它学到的是一套可以迁移的操作先验并没有停留在对特定指令的死记硬背。数据规模这个实验证明了人手数据的规模在具身智能模型中依旧非常宝贵。这是一条清晰的 scaling 曲线。团队用从零训练、3K、6K、9.6K 小时四个预训练规模跑了对照随着数据量上去预训练损失收敛得更低真机成功率也稳步爬升到 9.6K 小时时达到 60%而完全从零训练的模型只有约 30%。三十个百分点的差距几乎全部来自预训练数据。横向和同期工作比在一组 10 个相对容易的任务上EgoSteer 平均成功率 74%同期的 Being-H0.5 是 39%π0.5 是 22%。论文的分析是这两个对比模型都吃亏在预训练和后训练阶段的动作表示不一致、输入分辨率更小、缺少部署优化所以只能应付最基本的抓放指令跟随弱、泛化有限、执行也不够精准。预训练价值的终极检验最后一问也是最能体现预训练价值的一问一个在人手视频上预训练好的模型能不能只用少量示范就快速学会一个全新的、跨本体的、复杂的长程任务。两个实验给了答案。在 RealMan 机器人上仅用 120 条示范EgoSteer 就在一个 18 步、耗时 40 秒的折纸盒任务上做到了 75% 成功率。在换了一套本体的 AgiBot G1 机器人上仅用 200 条示范在一个 9 步、耗时 1 分钟的拆蛋糕盒任务上做到了 83%。对照组的结果近乎残酷。同样的数据量下传统模仿学习方法 Diffusion Policy 和 IMLE、以及没有做过预训练的同架构模型在这两个长程任务上的成功率全部是 0%。真正让「少样本学会一个长程任务」成为可能的是近万小时人手视频攒下的操作先验而不单单是模型架构本身。更多技术信息请参阅原论文。