跳到正文
arXiv cs.RO 机器人学· Yu Liu, Hetian Guo, Tianlv Huang, Ziyi Cai, Wudi Chen, Hantang Wang, Qiutong Liu, Yingzhi Peng, Wei Han, Peijun Tang, Jianan Wang, Zipei Fan, Zhiyuan Zha, Xuan Song·· 4 小时前AI 评分51

PLaW-VLA:面向视觉-语言-动作策略的预测性潜世界模型

PLaW-VLA: Predictive Latent World Modeling for Vision-Language-Action Policies

AI 导读

PLaW-VLA 在预训练的预测导向表示空间中建模任务相关的未来状态,基于 Mixture-of-Transformers 架构,通过结构化因果注意力将观测历史、当前任务语义和预测的未来状态条件化到动作生成。

来源:arXiv cs.RO 机器人学 · arxiv.org