【EC Portfolio News】移动操控感知错配迎来新解法!无界智航联合高校重磅推出 MoPA
2026-09-18
一台移动机器人要同时做好两件事:底盘判断“往哪走”,机械臂想判断“手怎么伸”。二者动作空间不同,却连在同一条运动链上,因此,只要底盘偏了,手臂抓取再精准也会落空。这正是移动操控比桌面抓取更复杂的地方。
过去不少方法为两类动作设置了不同的输出头或专家,但问题在于,在进入动作模块前,它们往往仍共享一份混合后的视觉表示。控制模块分开了,输入信息却没有按任务分开。
近日,无界智航Xspark AI 联合清华大学、香港科技大学(广州)、香港大学提出基于子系统专属感知对齐的协同移动操控策略 MoPA。它的核心在于:底盘和机械臂继续共享视觉语言上下文,但分别读取与自身任务相关的信息,生成动作时再对齐。
验证结果显示,在收水果、按颜色分拣、跨桌搬运和微波炉取物四项真机任务中,MoPA 的完整任务平均成功率达到76.3%,比最强对比方法 π0.5 高12.5个百分点。
项目主页:https://mopa-policy.github.io/
论文:https://arxiv.org/abs/2609.12081
两组感知分流,动作协同一致
移动机器人通常同时接收头摄、腕摄、本体状态和语言指令。视觉语言模型先把这些编成一串特征,再交给动作模型去生成底盘速度和手臂轨迹。
乍看之下,一份视觉表示的内容越全越好。可底盘和机械臂需要的重点不同,都从同一份表示中取信息,需求就可能互相干扰;训练时两条动作分支又共同更新前面的融合层,模型很容易学到一份“谁都能用、谁都不够专”的折中表示。
MoPA 的破解思路是“分开看,一起做”:在同一段视觉语言上下文中,让底盘和机械臂各自形成稳定的感知条件,到行动阶段再保持同步。
MoPA 的第一步叫双感知流(Dual Perceptual Streams)。Qwen3-VL 先读取头部与腕部RGB图像以及语言指令,得到共享的视觉语言上下文。随后,模型放入两组可学习的查询向量:Mobile Query 负责为移动底盘提炼信息,Manip Query 负责为机械臂提炼信息。两组都能看原始输入,但彼此屏蔽,不能互相抄答案。
这样做的目的,是让两条感知流在进入动作解码器之前就形成各自持续存在的中间表示。它们仍共享上游视觉语言模型,保留共同语境,只是各自挑选重点的路径分开了。

MoPA 整体架构:两组 Query 从共享视觉语言上下文中分别提取移动与操作信息,并连接到各自的动作专家
感知分流之后,动作仍可能不同步,例如底盘往左靠、机械臂却按照右站位来规划。为此,MoPA 的第二步 Perception2Action Adaptation 采用结构化的 Mixture-of-Transformers 解码器:移动与操作各有独立参数和动作 Token ,每组 Query 只连接自己的动作流,且两条动作流可通过联合注意力交换信息。
随着动作逐层推进,Query 状态也会和对应的动作 Token 更新。也就是说,底盘在逐步形成移动方案时,会重新判断哪些场景线索最重要;机械臂在逐步形成抓取方案时,也会不断重估目标附近的证据。正在生成的动作会反向校准感知,由此形成更缜密的“看见—决策”闭环。
最后,模型通过耦合条件流匹配,同时生成底盘与机械臂的动作块。训练时,两条分支使用同一时间进度;推理时,它们从各自的随机噪声出发,在相同步骤中反复交换当前动作状态,再一起走向最终轨迹。
模拟三项领先,真机平均成功率达 76.3%
论文先在 ManiSkill-HAB 上测试。这个家庭场景基准包含摆桌、整理房间和准备食材三组任务,内含拿苹果、放碗等简单技能,也有打开冰箱、抽屉等需要移动与操作连续配合的技能。每项技能使用1000条成功示范。
MoPA 在摆桌、整理房间、准备食材任务上的平均成功率分别为88.3%、72.2%、67.8%,明显领先于 DP、AC-DiT、π0.5。相对各组任务的最强基线,分别高出4.5%、17.0%、7.1%。这显示出 MoPA 具备跨技能整体协调的优势。
真机平台由 HexFellow 全向移动底盘、升降机构、两只 PiPER-X 六自由度机械臂和三台 RGB-D 相机构成。研究团队为每项任务采集200条示范,并在每种方法上进行20次完整任务测试。
MoPA 在收水果、颜色分拣、跨桌搬运、微波炉取物任务上的成功率分别为85%、90%、75%、55%,前三项领先,微波炉取物与 π0.5 持平。

四项真机任务及完整任务成功率。 MoPA 在前三项领先,在微波炉取物上与 π0.5 持平
消融实验:关键在于感知入口
MoPA 最有说服力的证据来自消融实验。在 SetTable 上,若把视觉语言模型的隐藏状态直接交给动作分支,平均成功率只有58.4%;加入一组共享 Query 后,升至74.7%;让移动与操作各用一组 Query ,完整模型达到88.3%。数据说明,可学习的感知摘要本身有效,进一步把摘要按子系统分开,才能放出更大收益。
消融实验还表明,允许模型“看更多”并没有带来更好的效果。冻结 Query、不让它随动作生成更新,成功率降到70.3%;让每条动作流同时读取两组 Query,对应关系被打散,成功率降到66.3%。对移动底盘和机械臂而言,信息入口的边界也是一种有用的结构先验。
Query 数量也不是越多越好。每个分支放置4、8、16个 Query 时,成功率分别为74.6%、88.3%和 82.5%。放置8个 Query 效果最好,继续扩容反而回落。这说明,子系统对齐靠的是合适的信息带宽,而不是简单的扩容。
注意力可视化把这种分工呈现得更直观。两类 Query 学到的是对同一世界的两种工作视角,而非两套互不相干的世界模型。

同一画面中, Mobile Query 更关注地面与周围结构, Manip Query 更集中在目标附近

推理阶段的余弦相似度热力图(左)和 t-SNE(右)显示,两类 Query 大体落在不同区域,同时保留少量重叠
子系统对齐,正在变成移动操控的底座能力
增强感知和拆分动作,是近几年移动操控的两条主线。MoPA 的思路落在两条路线的接缝处:模型拥有多少信息固然重要,信息以什么形式交给谁,同样决定最终的动作质量。
这一设计启发可以推广到更多形态。人形机器人可能需要为行走、双手操作和主动视角分别建立感知通道;双臂系统可能需要在左右手局部证据与共同任务目标之间分层通信;带升降躯干的移动平台,也可能把高度调整视为独立子系统。重点不是无限复制专家,而是先厘清各执行子系统依赖的证据,再划定通信边界。
移动操控是具身执行进入真实场景的关键能力,而实现“子系统对齐”,是无法绕开的课题。Xspark AI 联合高校提出 MoPA,正是要把看得清、走得准、抓得稳接到同一条执行链路上。
当然,亟待回答的问题还有很多:固定的两组 Query 能否覆盖更复杂的全身机器人;不同控制频率如何异步协同;现有真机规模能否支撑家庭长尾与失败恢复;长期部署如何把短时对齐接到记忆、监控和在线纠错……
Xspark AI 仍将深化产学研协同发展,推进 MoPA 的迭代与验证。同时,依托公司既有的覆盖模型、触觉、数据、评测体系的全栈基础设施,助力具身智能走向真正的可信落地。
扫描二维码分享到微信