跳到正文
arXiv cs.RO 机器人学· Yonghoon Dong, Minsung Yoon, Jaehyuk Kim, Jungwoo Park, Changyeon Kim, Jinwoo Shin·· 7 小时前AI 评分55

SQAM:用标量伴随匹配实现流策略的 Q-Learning 微调

Q-Learning with Scalar Adjoint Matching

AI 导读

论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。

来源:arXiv cs.RO 机器人学 · arxiv.org