跳到正文
热点事件持续更新

提出Run-then-Walk两阶段GRPO奖励调度策略

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

Yuqi Ye 等研究者提出Run-then-Walk两阶段奖励调度策略,用于VLM自动驾驶规划的GRPO强化学习训练:先用Run阶段激进探索高进度、摆脱保守偏置,再用Walk阶段引入终点和安全奖励修复不安全行为。作者称该方法在NAVSIMv1、NAVSIMv2、Navhard、nuScenes等多个基准、多种VLM规划器上验证,取得更好驾驶性能,且比基线少用40–50%的RL训练轮次。

AI 根据报道生成 · 50 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.RO 机器人学
    VLM自动驾驶规划的Run-then-Walk两阶段GRPO奖励调度策略

    论文提出Run-then-Walk两阶段奖励调度策略,用于VLM自动驾驶规划中的GRPO强化学习训练。作者发现两种RL机制:Run-GRPO激进探索高进度,Walk-GRPO在稳定进度后修复安全,因此先Run阶段让策略摆脱保守偏置、发现高进度模式,再Walk阶段引入终点和安全策略修复不安全行为。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。