跳到正文
arXiv cs.RO 机器人学· Stefan Richter, Alberto Giammarino, Guillem Torrente, Sam Blakeman, Peter D\"urr·· 6 小时前AI 评分54

FAOC:通过可行动作映射衔接强化学习与最优控制

Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping

AI 导读

论文提出 FAOC 框架,将强化学习与最优控制结合,通过基于优化的映射算法把 RL 智能体的抽象动作转换为最优控制问题中依赖状态的可行参数集,保证参数瞬时可行。配合不变终端集,FAOC 保证严格递归可行与安全运行,且抽象动作空间无需专家调参。在机器人乒乓球实时运动规划的仿真实验中,其样本效率与闭环性能优于现有基线,映射算法与运动规划 OCP 实现已开源。

来源:arXiv cs.RO 机器人学 · arxiv.org