arXiv cs.RO 机器人学· Shaohan Jiang, Jiahang Cao, Qiduo He, Fengting Deng, Kun Wu, Jingkai Sun, Jiaxu Wang, Qiang Zhang, Qihao Zheng, Chunfeng Song, Ping Luo, Andrew F. Luo·· 2 天前精选AI 评分58
研究揭示 VLA 机器人策略存在视觉接地缺口,任务成功未必遵循指令
Encoded but Not in Control: Revealing the Grounding Gap in Vision-Language Robot Policies
AI 导读
该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。
推荐理由
论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。
来源:arXiv cs.RO 机器人学 · arxiv.org