跳到正文
arXiv cs.RO 机器人学· Eren Sadikoglu, Aditya Taparia, Xinyuan Liu, Ransalu Senanayake·· 2 天前AI 评分49

ROOT:面向用户指定具身行为的奖励函数发现框架

ROOT: Discovering Rewards for User-Specified Embodied Behaviors

AI 导读

ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。

来源:arXiv cs.RO 机器人学 · arxiv.org