跳到正文
Sanctuary AI 新闻·· 6 天前精选AI 评分63

Sanctuary AI 提出 TIGER,用模仿策略作稠密奖励引导真机强化学习

Blog Post TIGER: Task-Space Imitation Guidance for Efficient Reinforcement Learning Demonstrations as a compass, not a script Read More

AI 导读

Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。

推荐理由

原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。

来源:Sanctuary AI 新闻 · sanctuary.ai