Sanctuary AI 新闻·· 6 天前精选AI 评分63
Sanctuary AI 提出 TIGER,用模仿策略作稠密奖励引导真机强化学习
Blog Post TIGER: Task-Space Imitation Guidance for Efficient Reinforcement Learning Demonstrations as a compass, not a script Read More
AI 导读
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由
原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
来源:Sanctuary AI 新闻 · sanctuary.ai