arXiv cs.RO 机器人学· Rhythm Syed, Jean Mercat, Sedrick Keh, Kushal Arora, Paarth Shah, Aykut Onol, Mengchao Zhang, Tony Dear·· 2 天前AI 评分57
SUAVE 提出基于 Masked Diffusion 的统一视频-动作模型
SUAVE: Unified Video-Action Models via Masked Diffusion
AI 导读
SUAVE 提出一种单一词表的统一 Action-Video 模型,用 masked diffusion transformer 在共享序列中以离散 token 表示视频、动作与语言,通过推理时选择掩码位置即可切换为世界模型、机器人策略或视频-动作模型。
来源:arXiv cs.RO 机器人学 · arxiv.org