【EC Portfolio News】无界智航联合高校发布两项触觉成果——从视频读出全掌力,用人手交互训练世界模型
2026-09-20
近日,Xspark AI 联合多所国内顶尖高校,发布两项触觉相关研究。感知标注上,TouchSight 通过手套实测力与裸手外观的成对迁移,实现不装传感器,也能从第一人称视频读出双手全掌力。真机预测上,DexTouch-WM 通过对齐人机触觉布局与动作表示,实现用大规模人手交互监督灵巧手的视触世界模型。
两项成果的突破,都得益于公司自研的触觉—视觉多模态数据采集系统 HumanTouch:人手全掌接触被同步精准记录,才既撑得起从视频读力,也撑得起向真机世界模型迁移。
Xspark AI 在触觉领域具备深厚积累及前沿优势。我们相信,要让触觉真正助力实现可信的具身智能,关键不在于多接一路信号,而在于把接触做成可规模化的学习条件。
01 DexTouch-WM:对齐人机手感,用人手交互训练世界模型
视触世界模型一直很难做到灵巧手上,原因在于,触觉数据多半来自真机遥操作,跟特定本体和传感器绑在一起,很难实现规模化。
DexTouch-WM 的思路是:把触觉采集从机器人本体上解耦。这项工作由 Xspark AI 联合香港科技大学(广州)、北京大学、香港大学、清华大学共同完成。它先让人和机器人看到同一套全掌触觉、同一种动作表示,再让大规模人手交互去训练灵巧手的视触世界模型。

DexTouch-WM 总览。给定初始观测和动作序列,模型联合预测未来视频与触觉图。人手轨迹为后续迁到真机提供可扩展的接触动力学先验
人机共用触觉布局,人手动作映射到机器人
采集仍走 HumanTouch。人在自然操作中同步记录画面、双侧全掌压力和手部位姿。同一布局装到20个自由度的舞肌灵巧手上,由天玑机械臂带动。
接下来,团队把人手动作映射成机器人能用的67维动作,里面包括左右手腕、双手关节和头部相机的运动。观测对齐了,动作也对齐了,人手轨迹就可以直接监督面向真机的世界模型,不必再单独学一套把人的触觉翻译成机器人触觉的网络。

训练用可穿戴触觉布局。同一布局装到机器人手上,使人机共用一套触觉观测空间。每只手套记录360个 taxel,模型保留320个:五个4×4指尖垫和一个15×16掌垫
按手的结构来编码,预测动作引起的接触变化
指尖和掌心在空间上并不相邻,如果把全掌铺成一张普通图片,不相干的触点会被当成邻居。视频被压缩后的时间节拍,和触觉保持原速的时间节拍也不一样。
DexTouch-WM 因此按手的解剖结构来分开编码。具体而言,指尖和掌区分开编码,预测相对初始触觉的变化;视频和触觉再按各自的时间节拍读入动作。训练用了约100小时、50类日常双臂任务的人手数据,外加大约5小时真机交互。

DexTouch-WM 结构。左侧按指尖/掌区 tokenize 双手触觉;右侧视频专家与触觉专家通过双模态联合注意力交互,并保留各自通路
真机数据很少时,人手交互仍能提升接触预测
接下来的实验进一步探讨的问题是,真机数据不变,增加人手数据,能不能提升世界模型的能力?缩放实验给出了肯定的答案。
团队把5小时真机固定,人手数据从0分别10、50、100小时,再拿到训练时没见过的真机任务上测试。结果显示,从只用真机,到加入100小时人手,各项指标明显变好。

这说明,人手交互提供的,是可以迁到机器人上的运动和接触结构。对齐之后,人手经验不再只停在视频读力,而可以进入机器人对下一步会摸到什么的预测
DexTouch-WM 主页:https://arxiv.org/pdf/2609.20649
02 TouchSight:不装传感器,也能从视频读“力”
触觉学习一直很难像视觉那样放大,原因出在采集结构上:
每一条可用的全掌力标签,都要求接触面上真有传感器;
手套数据几乎永远带着固定外观,迁到裸手视频上则不准确;
现有“第一人称视频—稠密全掌力”配对数据不足,往往只有数小时,或只有几十万帧。
更大的公开语料多半是把多个手物交互集合并起来,标签来自网格距离或热成像,给出的是接触有无,而非实测力。
现有方法还常依赖外部手部重建,遮挡、动作模糊或手套/裸手外观差时难以重建。
针对前述困境,Xspark AI 联合清华大学、香港科技大学(广州)、香港大学共同提出了 TouchSight。
其策略很明确:先在大规模手套数据上学会力,再把同一套力标签迁到裸手外观的视频上。如此一来,不装传感器,也能从第一人称视频读出双手全掌力和掌侧接触信息。

TouchSight 总览。HumanTouch 提供实测全掌力;TwinTouch 把同一交互迁到裸手外观并保留力标签;五个公开手物交互数据集提供几何接触监督。推理时只吃单目 RGB
只换手套外观,实测力标签原样留下
HumanTouch 提供了约500小时的实测全掌力语料,带同步的 taxel 级力和手部位姿。不过,它的采集现场相对固定,画面几乎永远是戴手套的手;只在这种外观上训练,遇到裸手和新背景就容易失效,重新再采一遍力,成本又提高了。
团队给出的解法是,从中均匀抽出约10小时、覆盖52类任务和10个场景的片段,用生成视频把手套改成裸手、把背景换成新环境,动作和实测力标签保持不变,构成时长共20小时、成对出现的 TwinTouch-20H。

TwinTouch-20H 总览
生成视频只改变了外观,所以下一步必须保证视觉和触觉对齐。

对齐质检
质检时,原手套画面半透明叠到生成视频上,只要姿态对不齐、物体消失或手形扭曲,这条样本就不能进入训练集。
另有约22小时公开的手物交互视频,它们只提供几何接触,用来补足裸手场景的多样性。
训练时,手套力、成对裸手力和几何接触按固定比例混合。
语义和几何一起看,推理不再依赖外部手部重建
接触本质上是几何问题。两帧画面可以很像,接触状态却完全不同。现有不少方法把现成的手部重建当结构先验,但手被挡住、外观对不上时重建就会失败。另一类方法把整段视频压成一个向量,但无法解出指尖或掌心的区域级受力。
TouchSight 则另辟蹊径。它把语义特征和几何特征对称地合在一起,再按时间区分靠近、按下和松开,最后用十个区域查询分别解出五指和手掌施加的力。同一组查询还会判断掌侧有没有碰到物体。戴手套的片段用来监督力的大小,公开视频只监督有没有接触。测试时,模型只使用事先训练好、不再更新的视觉特征,不再调用外部手部位姿。

TouchSight 结构。语义特征和几何特征先融合,再经过时空注意力和区域查询解码。使用阶段只输入 RGB
公开基准表现卓越
预测结果显示,几何信息和时间信息都对预测接触有用。拿掉刻画空间关系的几何特征后,预测力随时间变化的相关性从0.567降到0.451。拿掉时间模块后,把所有传感点平均起来的误差有时看起来更好,但真正在受力的那些点反而更不准。
裸手外观上的提升,也被证明是 TwinTouch 的功劳。把 TwinTouch 加进训练后,平均误差从1.851降到1.671,预测力分布和真实力分布的重合程度从0.239升到0.300。

TwinTouch 测试片段上的裸手力预测。模型只看裸手彩色画面;成对的手套记录提供力的真值。预测力集中在双手主要受力区
在公开的手物交互基准 OakInk2 上,接触落点也更局部、更稳。TouchSight 区分接触与非接触的能力打分为0.820,综合表现F1为0.373,整体优于 BSTRO、DECO、HACO 这几类先前方法。TouchSight 的精度为0.467,接触范围更克制,也更接近按几何距离得到的真值。

OakInk2 上的二值接触估计。蓝色为接触、灰色为非接触。TouchSight 的接触区更克制、更接近几何真值
手套上的实测力给得越多,真正受力的那些点越准。把这类监督从0%加到100%,相关性从0.358升到0.762;前10%数据带来的提升最大,此后仍在变好。对 Ego4D 这类没有测过力的自然第一人称视频,目前只能做定性观察:预测出力会随着看得见的交互起伏,并落在真正发力的指掌区域。

在 Ego-Exo4D、Ego4D、EgoDex 自然视频上的定性结果。这些数据没有实测力,只说明模型能对可见交互给出随时间变化的局部力响应

手套监督从10%增到100%时,主动受力点上的误差单调下降,偏差逐步靠近零
TouchSight 项目主页:https://arxiv.org/pdf/2609.20414
03 让人手触觉变成可扩展的训练资产
触觉是具身智能走进真实世界的关键。如何让触觉采集更精准、更高效,让触觉信号真正发挥训练模型和实际应用的价值,成为无法绕开的问题。
Xspark AI 联合团队给出了具备潜力的解决方案。TouchSight 让没有传感器的第一人称视频,也能够读出力和接触的细节;DexTouch-WM 让对齐后的人手交互,成为提高世界模型接触预测的燃料。触觉由此不再只是戴在手上的一层硬件,而开始变成可迁移、可扩展的训练资产。
这得益于公司在触觉领域的深厚积累。从自研多光谱传感器 SuperTac(相关成果系全球首篇 Nature 触觉大模型论文),到自研触觉-视觉多模态数据采集系统 HumanTouch,再到推出 TouchSight 和 DexTouch-WM,Xspark AI 在触觉研究的每一步,都走得扎实且精彩。
扫描二维码分享到微信