arXiv cs.RO 机器人学· Morgan Byrd, Jacob Blevins, Maks Sorokin, Robert Wright, Sehoon Ha·· 1 天前AI 评分47
Reward as Observation:仅以奖励为条件的策略实现零样本跨环境迁移
Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation
AI 导读
论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。
来源:arXiv cs.RO 机器人学 · arxiv.org