FineART:细粒度标注双臂操作数据集与 FineART-VLA 模型
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。
推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。
推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。