arXiv cs.RO 机器人学· Lars Ankile, Perry Dong, Rohan Bhowmik, Aneesh Muppidi, David D. Yuan, Shuran Song, Chelsea Finn·· 2 天前精选AI 评分58
Mulligan 提出面向机器人在机学习的性能引导数据采集方法
Mulligan: Performance-Guided Data Collection for Efficient On-Robot Learning
AI 导读
Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。
推荐理由
论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。
来源:arXiv cs.RO 机器人学 · arxiv.org