跳到正文
热点事件持续更新

DRIVE以成功轨迹多样性提升VLA泛化

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

Haoru Li 等提出 DRIVE 方法,把成功行为的多样性显式纳入 VLA 策略的 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖,而不奖励失败的多样或表面时序差异。 论文报告,在 LIBERO-Plus、ManiSkill3、RoboTwin 2.0 上,DRIVE 相比普通 RL 微调将平均域外(OOD)性能在 π₀ 上提升 5.3 个百分点、在 π₀.₅ 上提升 2.0 个百分点;在双臂 AgileX PiPER-X 真机平台上,平均 OOD 成功率从 64.1% 提高到 73.3%(+9.2 个百分点)。

AI 根据报道生成 · 7 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.RO 机器人学
    DRIVE:以成功轨迹多样性为目标提升 VLA 泛化的 RL 微调方法

    论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。

本事件热度走势

可比范围当前
8
可比范围峰值
1010月8日 13:00
近 24 小时变化
–

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。