跳到正文
arXiv cs.RO 机器人学· Jaemin Kim, Jiahn Kim, Taesik Gong·· 2 天前AI 评分53

VLA-ZO:面向视觉-语言-动作模型的快速零阶适配框架

VLA-ZO: Fast Zeroth-Order Adaptation for Vision-Language-Action Models

AI 导读

VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。

来源:arXiv cs.RO 机器人学 · arxiv.org