arXiv cs.RO 机器人学· Zhihao Liu, Qiuyi Gu, Yitao Wang, Dongming Qiao, Yixian Zhang, Shuaihang Chen, Liangzhi Shi, Tianxing Zhou, Zefang Huang, Kang Chen, Zhen Guo, Quanlu Zhang, Jincheng Yu, Xiaodan Liang, Guoliang Fan, Yu Wang, Feng Gao, Xinlei Chen, Chao Yu·· 4 小时前AI 评分55
STEAM:面向真实机器人学习的自监督时间集成优势建模
STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning
AI 导读
STEAM 提出一种无标签方法,从专家演示中学习帧级优势,用以区分可靠进展与失败回退。它在专家轨迹的帧对上训练时间偏移预测器集成,以归一化时间偏移作为自监督信号,将预测分布转为标量优势并取集成最小值保守打分混合质量 rollout 数据。在真实双臂叠毛巾、芯片结账、桌面清理和可乐补货四项任务上,STEAM 结合 CFGRL 取得最高成功率,平均 83.5%,对比最佳基线 58.8%。
来源:arXiv cs.RO 机器人学 · arxiv.org