【EC Portfolio News】首个“即插即用”机器人主动力控框架来了!Xspark AI无界智航联合多方重磅推出UniReflex

2026-08-21

 

        机器人如何精准控制力度,一直是具身智能行业的困扰。

 

        一台机器人已经把薄片工具送到便利贴边缘,但最难的一步才刚开始:工具既要贴住桌面,又要沿着边缘向前;力小了撬不起来,力大了又可能顶住或滑开。

 

        在这项任务里,常规生成式操作策略的成功率只有30%。接上UniReflex后,成功率大幅提升至90%。重点在于,这次提升没有依赖整套模型重新训练,原有策略全部冻结,系统只增加了一个快速反射网络。

 

        近日,Xspark AI联合清华大学深圳国际研究生院、南洋理工大学、X Square Robot,重磅推出行业首个“即插即用”的机器人主动力控框架UniReflex。它面向Diffusion Policy、π₀、DreamZero等主流生成式策略,在不微调慢速主干的前提下,通过快慢反射耦合补上闭环力调控,显著提升持续接触任务的稳定性与成功率。

 

        Xspark AI致力于推动可信物理智能在真实世界中稳定、可信、安全地执行任务。UniReflex正是这一判断在执行层的又一次落地。

 

 

 

轨迹规划到位,不等于接触就能稳住

 

        现在的机器人操作策略很擅长根据图像规划动作。它们可以找到工具和目标,也能生成手臂接下来的运动轨迹,在桌面抓取、放置一类任务上表现不弱。

 

        但面对擦拭、插入、剥离、持续按压这类,既要接触、又对力很敏感的任务,机器人的表现往往很差。

 

        常见做法是一次生成一小段动作,再交给底层控制器照着跟随。方向未必错,但系统通常不会持续判断现在压得太重还是太轻,也不会及时调整手臂在不同方向上的软硬程度。

 

        位置到了,力道不对,任务仍然会失败。

 

        目前看来,生成式策略更擅长规划“手往哪走”,却不太会在碰到物体后持续管“该用多大劲”。如果为了补力控,把力信号硬塞进大模型里重新做端到端训练,不仅贵,还可能把已经学会的视觉和动作能力冲掉。

 

        而Xspark AI提出了一条更省事的思路:给原策略旁边外挂一层接触反射,而不是每次都重训整颗“大脑”。这也正是UniReflex的切入点。

 

 

 

把力控做成可外挂的快反射

 

        UniReflex的做法很直接:原来的生成式策略继续负责看图、规划动作,本身不需要重训;旁边再加一个专门管接触力的快速模块。

 

        原策略一次会给出一小段动作意图,这被研究团队称为“慢速意图”。慢的不是动作本身,而是指主策略还要处理图像、理解场景,再一次生成一段动作,很难跟上接触力的快速变化。UniReflex则在动作即将输出之前,读取这组意图,里面包含着“接下来准备往哪里走、这一段动作想完成什么”的线索。

 

        在此基础上,系统增加了一个快速网络,每秒运行约50次。它同时接收主策略意图,以及机器人刚测到的力、关节电流等本体反馈,每次回答三件事:下一小步往哪里修正、应该保持多大接触力、手臂在各个方向上应该有多硬。底层控制器每秒运行约200次,把这些结果立刻变成机械臂动作。

 

        至此,UniReflex的三层分工可以浓缩为一句话:主策略决定要做什么,快速网络判断手上发生了什么,底层控制器马上调整怎么用力。

 

原有策略负责生成动作意图,快速网络读取实时受力并输出位姿修正、期望力和手臂刚度

 

        快速网络需要知道什么样的力才是合适的。研究团队没有额外搭建一套复杂的力示教设备,而是利用原有遥操作记录:人控制主机械臂,机器人跟随;两边在接触时产生的位置差,可以反映操作者正在朝哪个方向施力。系统据此学习哪些方向应该更硬,哪些方向应该顺着环境变化。

 

        另一处关键设计是接触门控。机器人接触物体前,仍由原策略负责接近和对准;传感器确认接触后,快速网络才提高力和刚度调节的权重。这样既补上接触力控,又尽量不带偏原来已经会做的动作。

 

        这套设计刻意把两件事拆开:视觉与任务规划可以继续用通用数据来学;接触时怎么用力,则更依赖具体机器人、传感器和任务。如果硬塞进同一个模型里,换一种力传感或换一套控制器,往往整套都要重训。而UniReflex选择把快速反射单独拿出来,改动范围会小很多。

 

        论文也验证了同一反射接口可以跨策略迁移:Diffusion Policy、π₀与DreamZero,都能在主干冻结的条件下接入。

 

 

 

接触阶段成功率普遍提高20—60个百分点

 

        方法能否成立,最终要看真机。研究团队设计了五类双臂任务:擦曲面、擦斜面、插充电器、揭贴纸和翻转盒子。每个任务都分两段:

 

• 第一段:先接近、拿工具。(看原来会不会找目标和拿东西)

 

• 第二段:进入擦、插、揭、翻。(检验碰到物体后能不能控住力道)

 

 

五类任务都包含接近目标和持续接触两个阶段,物体还会发生滚动、移动、倾斜或形变

 

        只有前一段基本不变、后一段明显提高,才能说明新模块补的是接触能力,而不是把整题重学了一遍。

 

        接入UniReflex后,三种主策略在接近、拿取和移动阶段的成功率变化不超过10%,位置控制能力变化不大。差距主要出现在接触阶段。在擦拭、揭贴纸和翻转盒子等持续接触任务上,三种主策略的成功率普遍提高20%—60%。以其中一套策略为例,揭贴纸从30%升到90%,两项擦拭都从30%升到70%。相对RDP、ForceVLA、TA-VLA等端到端力感知基线,UniReflex也更好保住了原规划器的位置质量,并在多数接触子任务上达到或超过最佳单体结果。

 

        这说明,UniReflex能够在基本保持原有位置精度的前提下,显著提升了接触稳定性和成功率。

 

        为了进一步检验效果,团队故意把环境弄乱:揭贴纸时不断改变支撑面角度,擦曲面时按压板材使其变形,翻转盒子时突然碰动物体。原策略受到这些干扰后,只有10%—20%的测试能够恢复;加入UniReflex后,恢复率达到80%—100%,重新找回合适接触力仅需0.87—1.28秒。即便机械臂在接触前出现1—2厘米位置偏差,仍有70%—90%的测试能把后续动作救回来。

 

 

支撑面移动、板材变形或物体被碰动后,原策略容易失去接触,UniReflex会根据实时受力继续修正

 

        消融实验进一步说明提升依赖的是UniReflex整体系统。完整系统在三项任务上的接触成功率是70%—90%;取消动态刚度、改成固定刚度,或只预测作用力,成功率掉到20%—50%,受力误差明显变大。若把门控拿掉,让快网从一开始就介入,接近阶段只剩0%—30%,接触阶段只剩0%—10%。动态刚度负责在接触中稳住,门控负责保护原来已经会做的动作。

 

        值得注意的是,并非所有任务都同等收益,如插充电器没有获得稳定提升。原因在于,擦拭和揭取需要机器人在一段时间里持续贴住物体,快速网络有机会多次观察受力并逐步修正;插头进入插座的接触时间很短,瞬时冲击强,允许的位置误差又很小,系统还没来得及通过连续反馈调整,结果往往已经定了。目前,UniReflex解决的是持续接触中的快速调力,不是所有接触问题的统一答案。

 

        工程侧的变化同样直接。三种主策略接入后,只需要训练相当于主模型0.188%—0.375%的参数;在单张NVIDIA A800上,快速网络的单步反向传播时延大约比整模联合训练低25—66倍。

 

        这里的25-66倍指单步反向传播时延,并不等于完整训练周期也缩短同样倍数。它说明的核心是:UniReflex可以保留已经训练好的视觉和动作能力,只针对新的机器人、新的力传感器或新的接触任务更新一层较小的控制网络。

 

 

 

尾声

 

        从揭贴纸成功率提升,到扰动下仍能较快找回接触力,诸多数据已经证明了UniReflex思路的可行性:不动原策略,也可以把主动力控补上。

 

        但对具身智能落地来说,下一步真正重要的,往往不只是某一个任务分数变高,而是换机器人、换传感器、换接触任务之后,这层力控能否低成本复用。

 

        通用模型可以继续扩大数据和任务覆盖,但越靠近真实物体,摩擦、刚度、控制频率和硬件差异就越难被一个统一模型一次包办。因此,可复用的力控接口、遥操作中的施力数据,以及贴近硬件的快速适配层,正在成为连接通用策略与真实部署的关键一环。

 

        承载着让具身智能真正实现“可信”落地的使命,UniReflex仍将持续进化。

 

论文地址:https://arxiv.org/pdf/2608.17432

项目主页:https://unireflex.github.io/

扫描二维码分享到微信