跳到正文
arXiv cs.RO 机器人学· Yuqi Ye, Shangkun Sun, Junhong Lin, Jiayi Zhao, Changhao Peng, Wei Zheng, Guoqing Liu, Tiesong Zhao, Wei Gao·· 2 小时前AI 评分53

VLM自动驾驶规划的Run-then-Walk两阶段GRPO奖励调度策略

Sometimes You Gotta Run Before You Can Walk: Run-then-Walk Scheduling Strategy for VLM Autonomous Driving

AI 导读

论文提出Run-then-Walk两阶段奖励调度策略,用于VLM自动驾驶规划中的GRPO强化学习训练。作者发现两种RL机制:Run-GRPO激进探索高进度,Walk-GRPO在稳定进度后修复安全,因此先Run阶段让策略摆脱保守偏置、发现高进度模式,再Walk阶段引入终点和安全策略修复不安全行为。

来源:arXiv cs.RO 机器人学 · arxiv.org