跳到正文
arXiv cs.RO 机器人学· S K Swaminathan, Damiya Gondha, Theyanesh Eswaramoorthy Rajahkrishnan, Aritra Hazra·· 2 天前AI 评分45

面向在线目标条件强化学习的方向条件策略(DCP)

Direction-Conditioned Policies for Online Goal-Conditioned Reinforcement Learning

AI 导读

提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。

来源:arXiv cs.RO 机器人学 · arxiv.org