跳到正文
arXiv cs.RO 机器人学· Mousumi Das, Aditeya Prajapati, Abrar Anwar, Jesse Thomason·· 1 天前AI 评分55

SWAP:面向视觉-语言-动作模型的逐步动作策略路由框架

SWAP: Stepwise Action Policy Routing for Vision-Language-Action Models

AI 导读

SWAP 框架在机器人执行过程中动态组合多个 VLA 策略,将策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,而非整个回合固定使用单一策略。

来源:arXiv cs.RO 机器人学 · arxiv.org