跳到正文
热点事件持续更新

VPP2实现视频预测与动作零样本泛化

1 篇报道1 个报道来源7 小时前更新

先了解这件事

AI 综述

Guo 等人在 arXiv 公布 Video Prediction Policy 2(VPP2),一种通过大规模操作视频继续预训练、蒸馏为单步视觉规划器并以 mixture-of-transformers 架构引入动作模块的世界动作模型,论文称其在视频预测与动作生成上均实现零样本泛化。 论文公布的实验结果显示:VPP2-14B 在开放式任务的视频预测指令跟随成功率上比 Cosmos3-64B 高 11.0 个百分点;在真实世界零样本 ALOHA 操作任务上比最强基线成功率高 18.5 个百分点;经各基准专门的后训练后,在 LIBERO-Pro、LIBERO-OOD 和 RoboDojo 上取得所评测方法中最高成功率。

AI 根据报道生成 · 6 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.RO 机器人学
    VPP2 论文:提升视频预测以改善机器人操作策略的零样本泛化

    论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM),通过大规模操作视频继续预训练、蒸馏为单步视觉规划器,并以 mixture-of-transformers(MoT)架构引入动作模块,实现视频预测与动作生成的零样本泛化。

本事件热度走势

可比范围当前
8
可比范围峰值
1010月8日 13:00
近 24 小时变化
–

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。