arXiv cs.RO 机器人学· Eren Sadikoglu, Aditya Taparia, Xinyuan Liu, Ransalu Senanayake·· 2 天前AI 评分49
ROOT:面向用户指定具身行为的奖励函数发现框架
ROOT: Discovering Rewards for User-Specified Embodied Behaviors
AI 导读
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
来源:arXiv cs.RO 机器人学 · arxiv.org