arXiv cs.RO 机器人学· John L. Zhou, Yuxuan Dong, Jonathan C. Kao·· 6 小时前AI 评分50
目标条件策略学习中的"视界信息诅咒"
An Informational Curse of Horizon in Goal-Conditioned Policy Learning
AI 导读
研究在目标条件策略学习中识别出一种"视界信息诅咒":增大目标重标注视界会显著削弱策略泛化与性能,即便测试时只评估邻近子目标序列,行为克隆(BC)策略仍出现严重的、依赖训练视界的性能退化,而强化学习(RL)目标可缓解该现象。作者将其解释为动作与事后重标注目标之间条件互信息随视界下降,并发现将短视界策略的输入 Jacobian 蒸馏到长视界策略可在组合操作任务上带来显著性能提升。
来源:arXiv cs.RO 机器人学 · arxiv.org