Mulligan 提出面向机器人在机学习的性能引导数据采集方法
Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。
推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。