arXiv cs.RO 机器人学· Haoru Li, Jinmei Liu, Zhiyong Wang, Xiaoming Li, Zhenhong Sun, Daoyi Dong, Chunlin Chen, Zhi Wang·· 7 小时前AI 评分56
DRIVE:以成功轨迹多样性为目标提升 VLA 泛化的 RL 微调方法
Many Ways to Succeed: Diversity-Driven RL Fine-Tuning for VLA Generalization
AI 导读
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
来源:arXiv cs.RO 机器人学 · arxiv.org