RobotWorld发布:84项机器人任务仿真基准
研究团队推出RobotWorld仿真测试基准,把指令与观测转化为机器人接口上的物理任务执行,用于测试多模态智能体的机器人能力。其84项任务覆盖操作、移动操作、运动、驾驶与空中控制,并设有显式交互预算与可执行的成功判定。
最新进展RobotWorld:面向多模态智能体跨任务跨本体机器人能力的仿真基准
过去 7 天,嵌入式与具身智能圈讨论最多的 6 件事
10月8日 16:55 更新 · 按讨论热度排序
研究团队推出RobotWorld仿真测试基准,把指令与观测转化为机器人接口上的物理任务执行,用于测试多模态智能体的机器人能力。其84项任务覆盖操作、移动操作、运动、驾驶与空中控制,并设有显式交互预算与可执行的成功判定。
最新进展RobotWorld:面向多模态智能体跨任务跨本体机器人能力的仿真基准
Seungjun Moon 等提出 RLHND 手部追踪模型,从单目第一视角视频中联合估计手部位姿与贴近实际的触觉信息,作者称该方法可缓解现有方法仅从裁剪帧回归位姿导致的不准确和物理不一致问题。代码将公开发布。 该模型把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器;位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
Long-WAM 论文作者提出在实时控制约束下扩展因果世界-动作模型上下文的模型-系统框架,并报告实验结果:在 RoboCasa GR-1 上,把上下文从 0.0 秒增至 19.2 秒使成功率从 63.3% 升到 78.7%,但用双向预训练初始化的模型没有净提升——作者据此称,访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。 在 RTX 5090 上,每个动作块(含未来视频隐变量预测)耗时 107.4 毫秒;框架在 Unitree G1 与 YAM 上完成实时部署,支持动态与长时程操作,其中动态叠杯任务成功率 95%,而 Pi0.5 与 Fast-WAM 在 20 次试验中均未成功。