DRIVE以成功轨迹多样性提升VLA泛化
热点事件持续更新
DRIVE以成功轨迹多样性提升VLA泛化
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
Haoru Li 等提出 DRIVE 方法,把成功行为的多样性显式纳入 VLA 策略的 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖,而不奖励失败的多样或表面时序差异。 论文报告,在 LIBERO-Plus、ManiSkill3、RoboTwin 2.0 上,DRIVE 相比普通 RL 微调将平均域外(OOD)性能在 π₀ 上提升 5.3 个百分点、在 π₀.₅ 上提升 2.0 个百分点;在双臂 AgileX PiPER-X 真机平台上,平均 OOD 成功率从 64.1% 提高到 73.3%(+9.2 个百分点)。
AI 根据报道生成 · 7 小时前更新
最新进展10月8日 12:00
DRIVE:以成功轨迹多样性为目标提升 VLA 泛化的 RL 微调方法报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv cs.RO 机器人学DRIVE:以成功轨迹多样性为目标提升 VLA 泛化的 RL 微调方法
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
本事件热度走势
- 可比范围当前
- 8
- 可比范围峰值
- 1010月8日 13:00
- 近 24 小时变化
- –
02.557.510
13:0014:0015:0016:0017:0018:0019:00
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。