arXiv cs.RO 机器人学· Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin·· 4 小时前AI 评分53
NeurIPS 2026 论文提出 TRQAM,用信任域约束稳定离线强化学习微调
Trust Region Q Adjoint Matching
AI 导读
论文提出 Trust Region Q Adjoint Matching(TRQAM),一种稳定的离线策略微调算法,通过投影对偶下降自适应控制微调策略与预训练策略之间的路径空间 KL。
来源:arXiv cs.RO 机器人学 · arxiv.org