arXiv cs.RO 机器人学· Peng Cheng, Yunxian Hou, Zhi Zhou, Qian Zhang, Chang Huang, Xianyuan Zhan·· 2 小时前AI 评分55
NeurIPS 2026 论文:同时监督零阶与一阶动作提升策略控制鲁棒性
Higher-Order Action Supervision Makes A Strong Policy Class
AI 导读
论文提出一种新的损失方案,在监督动作标签(零阶动作)的同时监督一阶动作,以提升策略性能与控制鲁棒性,且无需对现有策略模型做结构改动,可作为即插即用模块接入多种离线 RL 框架。
来源:arXiv cs.RO 机器人学 · arxiv.org