跳到正文
arXiv cs.RO 机器人学· Theodor Wulff, Angelo Cangelosi·· 7 小时前AI 评分55

π0.5 与 GR00T N1.7 语言接地能力的机制可解释性研究

Do Vision-Language-Action Models Understand Instructions? A Mechanistic Interpretability Study on Language Grounding

AI 导读

论文对 π0.5 和 GR00T N1.7 两个 VLA 模型的语言接地能力开展机制可解释性研究,对其动作生成模块残差流施加 activation 与 attribution patching,并按同义替换、语义缩放、方向性破坏、随机物体替换、空字符串五种策略系统扰动 LIBERO 基准的任务指令。

来源:arXiv cs.RO 机器人学 · arxiv.org