arXiv cs.RO 机器人学· Philipp Schoch, Markus Ryll·· 2 天前AI 评分52
在未建模状态依赖下使用学习型 Critic 的最优控制
Optimal Control with Learned Critics under Unmodeled State Dependencies
AI 导读
该框架用残差动力学网络补全名义解析模型缺失的状态依赖效应,并以学习型动作价值 Critic 将长时域 MDP 结构注入局部 iLQR 优化。配套的 GPU 加速批量 iLQR 求解器可在最优控制回路内评估学习网络,并行求解数千条轨迹优化问题。在有偏且未完整建模的控制任务上,闭环控制性能得到提升,同时保留了约束轨迹优化所需的模型结构。
来源:arXiv cs.RO 机器人学 · arxiv.org