arXiv cs.RO 机器人学· Mousumi Das, Aditeya Prajapati, Abrar Anwar, Jesse Thomason·· 1 天前AI 评分55
SWAP:面向视觉-语言-动作模型的逐步动作策略路由框架
SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models
AI 导读
SWAP 框架在机器人执行过程中动态组合多个 VLA 策略,将策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,而非整个回合固定使用单一策略。
来源:arXiv cs.RO 机器人学 · arxiv.org