跳到正文
arXiv cs.RO 机器人学· Chung Min Kim, Brent Yi, David McAllister, Hongsuk Choi, Himanshu Gaurav Singh, Jinkun Cao, Ken Goldberg, Pieter Abbeel, Carmelo Sferrazza, Angjoo Kanazawa·· 1 天前精选AI 评分58

QF3:用过滤 Q 梯度加速流策略强化学习的人形运动控制算法

QF3: Fast Flow RL with Filtered Q-Gradients

AI 导读

论文提出 QF3(Fast Flow RL with Filtered Q-Gradients),一种在线离策略 RL 算法,通过 flow matching 加上 critic 的动作梯度、经一步预测反向传播来训练流策略,且只将 critic 梯度施加于接近回放动作的那些动作维度。

推荐理由

论文给出相对 FPO++ 的 10x 训练加速和零样本上机结果,可评估该算法是否值得在人形运动控制任务中试用。

来源:arXiv cs.RO 机器人学 · arxiv.org