arXiv cs.RO 机器人学· Masatoshi Tateno, Takehiko Ohkawa, Yueh-Hua Wu, Hanlong Li, Tatsuya Matsushima, Yoichi Sato, Kei Ota·· 7 小时前AI 评分55
YUBI-STAG:通过自动视频语言对齐为 VLA 提供接触与语义丰富的标注
YUBI-STAG: Contact and Semantic-Rich Alignment for VLAs via Automated Video-Language Grounding
AI 导读
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。
来源:arXiv cs.RO 机器人学 · arxiv.org