跳到正文
arXiv cs.RO 机器人学· Dimitrios S. Georgiou, Augustinos D. Saravanos, Evangelos A. Theodorou·· 1 天前AI 评分49

Pareto-Optimal Entropy-Regularized Trajectory Optimization(PER-DDP):面向机器人轨迹优化的熵正则化 DDP 框架

Pareto-Optimal Entropy-Regularized Trajectory Optimization

AI 导读

PER-DDP 提出一种基于自由能/相对熵不等式推导的熵正则化种群框架,将先验引导采样、扩展 rollout 评估与 Pareto 过滤结合,在保留 DDP 二阶结构的同时把采样开销与优化种群规模解耦。在多个系统和数百个环境的评测中,PER-DDP 的成功率高于现有采样增强型轨迹优化方法,并能在所有基线方法均无法求解的环境中找到可靠解。

来源:arXiv cs.RO 机器人学 · arxiv.org