提出Run-then-Walk两阶段GRPO奖励调度策略
热点事件持续更新
提出Run-then-Walk两阶段GRPO奖励调度策略
1 篇报道1 个报道来源1 小时前更新
先了解这件事
AI 综述
Yuqi Ye 等研究者提出Run-then-Walk两阶段奖励调度策略,用于VLM自动驾驶规划的GRPO强化学习训练:先用Run阶段激进探索高进度、摆脱保守偏置,再用Walk阶段引入终点和安全奖励修复不安全行为。作者称该方法在NAVSIMv1、NAVSIMv2、Navhard、nuScenes等多个基准、多种VLM规划器上验证,取得更好驾驶性能,且比基线少用40–50%的RL训练轮次。
AI 根据报道生成 · 50 分钟前更新
最新进展10月9日 12:00
VLM自动驾驶规划的Run-then-Walk两阶段GRPO奖励调度策略报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.RO 机器人学VLM自动驾驶规划的Run-then-Walk两阶段GRPO奖励调度策略
论文提出Run-then-Walk两阶段奖励调度策略,用于VLM自动驾驶规划中的GRPO强化学习训练。作者发现两种RL机制:Run-GRPO激进探索高进度,Walk-GRPO在稳定进度后修复安全,因此先Run阶段让策略摆脱保守偏置、发现高进度模式,再Walk阶段引入终点和安全策略修复不安全行为。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。