跳到正文
热点事件观察中

ReBound提出免重置强化学习价值学习方法

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Kohei Honda 等人提出 ReBound(重置感知半马尔可夫自举),一种面向免重置强化学习的价值学习方法:把导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并按实际恢复时间折扣、从恢复后价值进行自举,同时用奖励中心化稳定价值学习。训练开始后无需人工干预。 在仿真与 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文以 arXiv:2604.07672 提交,共 9 页、6 幅图。

AI 根据报道生成 · 1 天前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv cs.RO 机器人学
    ReBound:基于重置感知半马尔可夫自举的免重置强化学习敏捷驾驶方法

    ReBound 提出一种面向免重置强化学习的价值学习方法,将导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并从恢复后价值按实际恢复时间折扣进行自举,同时用奖励中心化稳定价值学习。在仿真和 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文共 9 页、6 幅图,以 arXiv:2604.07672 提交。

本事件热度走势

可比范围当前
4
可比范围峰值
1010月7日 13:00
近 24 小时变化
-50%

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。