arXiv cs.RO 机器人学· Ryan Li, Yigit Korkmaz, Erdem B{\i}y{\i}k·· 2 天前AI 评分54
Reward-DAgger:基于通用进度奖励模型的机器人门控交互式模仿学习
Reward-DAgger: Robot-Gated Interactive Imitation Learning with General-Purpose Progress-Based Reward Models
AI 导读
Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。
来源:arXiv cs.RO 机器人学 · arxiv.org