跳到正文
arXiv cs.RO 机器人学· Morgan Byrd, Jacob Blevins, Maks Sorokin, Robert Wright, Sehoon Ha·· 1 天前AI 评分47

Reward as Observation:仅以奖励为条件的策略实现零样本跨环境迁移

Reward as Observation: Learning Reward-Based Policies for Rapid Adaptation

AI 导读

论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。

来源:arXiv cs.RO 机器人学 · arxiv.org