跳到正文
arXiv cs.RO 机器人学· Tuan Duong Trinh, Basim Azam, Mohammed Ishaq Ansari, Mohammed Yaqoob Ansari, Naveed Akhtar·· 4 小时前AI 评分55

推理链作为VLA策略控制接口的修复与破坏效应研究

Altered Thoughts, Altered Actions: Reasoning Chain as Control Surface for a Vision-Language-Action Policy

AI 导读

论文在LIBERO四套仿真任务上测量编辑VLA策略推理链对其电机动作的影响,发现破坏成本集中在语言单独决定目标的场景。在LIBERO-Goal上对DeepThinkVLA的反事实干预显示,用干净指令生成的推理链替换被污染指令下的推理链,可挽回47.8 pp的成功率损失;10个任务全部朝预测方向移动,但仍比干净运行低38.0 pp,作者此前预测该差距为5-15 pp。

来源:arXiv cs.RO 机器人学 · arxiv.org