arXiv cs.RO 机器人学· Andreu Matoses Gimenez, Andrei-Carlo Papuc, Chris Pek, Javier Alonso-Mora·· 2 天前AI 评分47
流策略作为技能级世界模型的动作:面向长时程规划的学习与符号抽象
Flow Policies as Actions of Skill-Level World Models: Learned and Symbolic Abstractions for Long-Horizon Planning
AI 导读
研究者用 flow-matching 策略的输入构造技能级动作,使一次完整技能执行对应一次世界模型转移,并提出压缩种子、两种从演示学习的离散码和符号标签四种动作抽象。在需最多 14 个顺序技能的模拟积木重排任务中,符号标签在最多六个技能的任务上成功率超 90%,无标签的物体中心学习码在单技能任务上与之相当。消融显示标签优势主要来自规划器知晓动作适用性,超过六个技能后限制成功率的是搜索而非世界模型。
来源:arXiv cs.RO 机器人学 · arxiv.org