跳到正文
arXiv cs.RO 机器人学· Philipp Schoch, Markus Ryll·· 2 天前AI 评分52

在未建模状态依赖下使用学习型 Critic 的最优控制

Optimal Control with Learned Critics under Unmodeled State Dependencies

AI 导读

该框架用残差动力学网络补全名义解析模型缺失的状态依赖效应,并以学习型动作价值 Critic 将长时域 MDP 结构注入局部 iLQR 优化。配套的 GPU 加速批量 iLQR 求解器可在最优控制回路内评估学习网络,并行求解数千条轨迹优化问题。在有偏且未完整建模的控制任务上,闭环控制性能得到提升,同时保留了约束轨迹优化所需的模型结构。

来源:arXiv cs.RO 机器人学 · arxiv.org