arXiv cs.RO 机器人学· Hikmet Simsir, Kutay Demiray, Ozgur S. Oguz·· 2 天前AI 评分47
RADPO:面向安全的可达性感知扩散策略优化方法
Reachability-Aware Diffusion Policy Optimization
AI 导读
RADPO 提出一种免模型的扩散策略优化方法,将预测首达安全估计与累积成本预算反馈结合,用于安全感知的连续控制强化学习。该方法学习折扣首达可达性值来塑造奖励,并用对偶式乘子按实际回合成本相对预算调整塑形强度,无需学习动力学模型、动作梯度或反向扩散采样器求导。在十项连续控制安全任务上,RADPO 取得有竞争力的奖励-成本权衡,多个任务的约束违反显著低于对比基线。
来源:arXiv cs.RO 机器人学 · arxiv.org