跳到正文
arXiv cs.RO 机器人学· Congsheng Xu, Qiaochu Yang, Fangyuan Shi, Yifan Han, Baijun Chen, Yiming Wang, Haonan Zhao, Zhe Liu, Yao Mu, Daolin Ma, Xiaokang Yang, Hesheng Wang·· 1 天前AI 评分47

VT-MUSE:面向视触觉操作的多模态统一序列表征学习框架

VT-MUSE: Multimodal Unified Sequential Visuotactile Representation Learning for Manipulation

AI 导读

VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。

来源:arXiv cs.RO 机器人学 · arxiv.org