arXiv cs.RO 机器人学· Yuan Xu, Yixiang Chen, Qisen Ma, Jiabing Yang, Peiyan Li, Kai Wang, Jianhua Yang, Jianlou Si, Jun Huang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang·· 1 天前AI 评分55
ViDAL:以视觉动态为锚的 VLA 动作隐空间
ViDAL: A Visual Dynamics-Grounded Action Latent Space for Vision-Language-Action Models
AI 导读
ViDAL 提出一种以未来场景视觉动态为锚的连续动作隐空间,通过训练 Action VAE 重建动作块并将隐变量与未来场景动态对齐,可作为即插即用的动作接口兼容多种 VLA 架构。
来源:arXiv cs.RO 机器人学 · arxiv.org