RobotWorld:面向多模态智能体跨具身机器人任务的仿真基准
论文提出 RobotWorld,一个面向机器人操作的仿真测试基准,包含 84 项任务,覆盖操作、移动操作、运动、驾驶与空中控制,设有明确的交互预算与可执行的成功判定。
论文提出 RobotWorld,一个面向机器人操作的仿真测试基准,包含 84 项任务,覆盖操作、移动操作、运动、驾驶与空中控制,设有明确的交互预算与可执行的成功判定。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。
跨 Tokenizer On-Policy 蒸馏研究发现,严格 1:1 对齐位置已覆盖学生生成的大部分 token,将 reverse KL 限制在每个严格位置的共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率。
TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。
推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。
论文提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则锚定在采样器上,通过最小二乘拟合采样器自身轨迹的 log-ratio 最优性条件,无需重要性权重即可完成策略更新。
研究团队提出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测集 ProactiveCoachBench 与自适应引导系统,在阶段、步骤、动作三个层级提供结构化引导数据。
东京初创公司MW把沿天花板轨道滑动的双臂机械臂MW bot集成进住宅,首批不含机器人版本定价2亿~4亿日元,已在东京、横滨、福冈推进项目,搭载机器人的版本计划2028年上市。
推荐理由:文章拆解了MW把机械臂集成进住宅的路线选择,以及它与双足人形方案在安全、算力和心理感受上的取舍。
PrisMem 提出能力驱动的智能体记忆自进化方法,通过依赖感知的能力选择与历史引导诊断来优化记忆程序,并在 BEAM-1M 和 LongMemEval-M 上分别以 10.54 和 7.83 个百分点的优势超过最强基线。
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
波士顿动力为新一代 Atlas 发布四指灵巧手,共 13 个自由度、直接驱动,尺寸接近大型人手且平均力量更强,可搬运装满 100lb+ 的小冰箱。手部配备覆盖指尖和掌面的密集压力触觉传感器,关节可反向驱动以实现本体感知,支持捏取、三指抓握和握持电钻、射钉枪、焊枪等带扳机工具。
推荐理由:原文解释了四指 13 自由度设计如何在灵巧性、强度与量产成本之间取舍,可为同类末端执行器选型提供参考。
AMD以约82亿美元全股票交易收购World Labs,李飞飞将加入AMD任执行副总裁兼首席科学家,交易预计2026年底前完成。文章借此梳理国内世界模型的三条路线:腾讯混元偏空间生成,群核科技偏空间数据与仿真训练,影身智能从多视角真实4D数据切入,经4D重建、世界模型到真机执行闭环。
推荐理由:原文把AMD收购World Labs与国内三条世界模型路线并置,可用来理解4D世界模型从数据到产线的落地差异。
智元与炊具品牌爱仕达合作落地,100台灵犀X2人形机器人进入爱仕达全国100家门店担任促销员,覆盖六十多个城市。双方在温岭、上海、无锡三地开展为期三天、每天10小时的直播,百店累计销售金额达225.3万元,带动门店业绩增长39%。
推荐理由:原文给出三天直播的销售金额与增长比例,并拆解了机器人与真人导购的分工边界,可作为零售部署的验收参照。
Skild AI 宣布通过物理自我对弈完成一项后训练突破,其机器人基础模型 S1 在与自身对弈的仿真中学会了踢足球等高度灵巧和动态的任务。模型只被给出进球这一个目标,在 NVIDIA Isaac Sim 中与近期版本的自己对抗,逐步自行学会带球过人、护球和铲球,这些行为因有助于进球而涌现,未手工设计奖励。
推荐理由:原文给出仿真时长、涌现行为和 sim-to-real 迁移结果,可据此评估自我对弈后训练路线在具身智能上的可行性。
Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。
推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。
机器人安全正从"故障时是否安全"转向"攻击者篡改感知与决策时是否安全",训练后门、系统漏洞与运行时感知操纵构成三层攻击面。NeurIPS 2025 的 BadVLA 针对 VLA 模型植入后门,GoBA 以咖啡杯等日常物品为触发器实现 97% 攻击成功率;UniPwn 利用硬编码密钥与命令注入可"蠕虫式"扩散至整机队。
Skild AI 在首次商业部署十个月后年度经常性收入突破 1 亿美元,其中约 90% 来自操作类任务,移动类占 10%,已积累 60 多家付费客户。公司正与 NVIDIA 和 Foxconn 合作,在双臂机械手上部署 Skild Brain 用于 NVIDIA Blackwell 系统的高精度装配,并在住友电装推进 S1 用于线束制造,与三井物产在商用厨房试点通用机器人。
推荐理由:原文给出十个月60多家付费客户的收入结构与部署案例,可看出具身智能商业化在操作类任务上的落地分布。
Figure AI 发布机器人训练数据集 Index,配套 App 已在 Google Play 与 App Store 上线,累计下载 264,000 次、覆盖 108 个国家,Creator 上传超 1600 万条视频,每秒处理 30 分钟视频上传。
推荐理由:原文披露了每千小时数据的任务与物体多样性指标,以及五阶段数据管线,可作为机器人数据采集规模化的参考。
Skild AI 发布旗舰机器人基础模型 S1,作为上下文学习器,仅凭一段视频演示即可执行未在预训练中出现、最长 10 分钟的操作任务,无需微调或后训练。在内部基准上,未见任务中 ICL 在 100k 小时预训练数据下达到 66% 成功率,语言提示 VLA 为 9%;已见任务中 S1 达到约 96%。一次上下文演示约等于 380 个后训练示例,植物移盆任务从演示到自主执行用时 11 分钟。
推荐理由:原文给出 ICL 与语言提示 VLA 在 1k 到 100k 小时预训练下的成功率对比,可作为评估提示范式选型的参考。
逐际动力随 COSA 0.5 发布 V³-0,即机器人 OS COSA 中 VLA-tools 层的首个版本,支持移动全身操作的人形 VLA 技术栈。V³-0 运行在 43 自由度的人形机器人 Oli 上,多级架构让感知、决策与执行在不同时间尺度协同运行,LimX-WBT 跟踪全身目标并维持动态平衡,统一移动与操作。
推荐理由:原文给出 V³-0 的多级架构与人类在环真机强化学习闭环,可作为人形 VLA 技术栈设计的参考。
逐际动力宣布完成 Pre-IPO 轮融资,融资金额近2亿美元,过去半年累计完成融资4亿美元。本轮投资方包括IDG资本、蓝思科技、GGG Group、华山资本、合肥滨湖产发集团等,阿联酋磊石资本连续追投,绿洲资本、基石资本、蔚来资本等老股东超额加注。
推荐理由:本轮资金用途点出大小脑融合技术产品化与数千台人形机器人规模化部署,可看出其下一步投入重点。
Figure 最新一代人形机器人 Figure 03 已抵达 BMW Group Plant Spartanburg 的 Hall 52,首次在该工厂演示物流排序(sequencing)工作流。
推荐理由:原文给出 Figure 02 去年参与装配 30,000 辆车的基线,可对照理解 Figure 03 从取放到排序任务的升级。
Sanctuary AI 宣布其 Physical AI 在一家全球 Tier 1 汽车供应商的复杂线缆插装任务上达到 99.5%+ 的任务成功率,节拍时间 2.54 秒,并通过客户实际产线基准验证。
推荐理由:原文给出了线缆插装任务的 99.5%+ 成功率与 2.54 秒节拍,可作为柔性物料自动化落地的参考基准。
波士顿动力与现代合作,用人类示范和强化学习训练 Atlas 人形机器人完成此前未见的 Ghost Rabona 花式踢球动作。团队用光学动作捕捉记录球员与工程师 Roberto 的高保真运动数据,经重定向映射到 Atlas 运动学结构后,在云端 GPU 并行数千次仿真训练,相当于 24 小时内完成一年的物理试错,学到的策略几乎全部首次上机即成功。该训练方法可迁移到仓储、工厂等实际作业任务。
Figure 演示两台 Helix-02 人形机器人在两分钟内协作完成卧室整理,包括开门、挂衣服、收耳机、合书、倒垃圾、推椅子和共同铺床。两台机器人共用一个学习得到的 Vision-Language-Action 策略,没有共享规划器、消息传递或中央协调器,各自通过相机读取场景并仅凭动作推断对方意图。
推荐理由:原文给出了双机器人协作的实现方式,即无共享规划器、仅靠各自相机推断对方意图,可作为多智能体操作的参考。
逐际动力正式开源 FluxVLA Engine,一个面向具身智能的标准化 VLA 工程底座,以统一配置、标准接口、模块解耦和加速部署为核心,打通数据处理、模型训练、仿真评测到真机部署全流程。
推荐理由:统一配置与模块解耦的设计思路,对需要在多个数据集和硬件平台间复用 VLA 训练流程的团队有参考价值。
Figure 宣布 BotQ 工厂已交付超过 350 台第三代人形机器人 Figure 03,产量从每天 1 台提升至每小时 1 台,120 天内实现 24 倍吞吐提升。
推荐理由:原文给出 BotQ 产线的节拍、良率和测试数据,可作为人形机器人量产爬坡阶段的一手参考。
Skild AI 宣布收购 Zebra Technologies 的机器人业务部门(前身为 Fetch Robotics),计划把自家 omni-bodied brain 部署到仓储履约流程中。
推荐理由:收购让 Skild Brain 与 Zebra 的 Symmetry Fulfillment 编排平台结合,可看出其在仓储场景落地通用具身模型的路径。
Sanctuary AI 展示其自研液压机械手的零样本手内操控能力:完全在仿真中训练的策略直接迁移到真实世界,仅用指尖(不借助手掌)连续 10 次将字母方块旋转到指定朝向而不掉落。该演示验证了仿真环境对真实动力学的高保真建模,以及液压驱动与紧凑液压阀在力量、速度和控制上的优势,为工业场景的精密插入与工具使用奠定基础。
Skild AI 宣布与 ABB Robotics、Universal Robots、Teradyne 旗下 MiR 合作,将 omni-bodied Skild Brain 基础模型集成到其机器人产品线,实现无需逐任务编程的跨行业部署。
推荐理由:原文给出了从半结构化工厂到家庭环境的分阶段落地路径,可作为具身智能规模化部署节奏的参考。
Figure 的 Helix 02 展示客厅整理演示,在此前厨房清理之后完成全身端到端的客厅收拾任务。演示中它用喷壶和毛巾清洁表面、双手搬收纳箱并把积木扫入、把枕头抛回沙发、在手中重新调整遥控器并按键关电视,还侧身穿过茶几与沙发之间的窄缝。Figure 表示这些行为没有新增算法或专门工程,仅靠添加新数据学会,沿用与此前任务相同的通用架构。
推荐理由:原文列出八类具体操作行为,可看出单一模型靠新增数据扩展任务的迁移方式。
Dexterity 公开其物理 AI 世界模型 Foresight,该模型基于生产环境中超过 1 亿次自主动作的经验训练,面向企业物流场景的安全关键型机器人应用。
推荐理由:原文给出世界模型在生产环境的训练规模与决策时延,可据此了解工业操作场景对世界模型的可解释与实时要求。
Figure 发布 Helix 02,用单一神经网络从像素直接控制人形机器人全身,实现行走、操作与平衡的一体化。该模型在 System 2 与 System 1 之下新增 System 0 全身控制器,基于超过 1,000 小时人体动作数据训练,10M 参数、以 1 kHz 输出关节指令,替代了 109,504 行手写 C++。
推荐理由:原文给出了 System 0 的训练数据量、参数规模和控制频率,可据此了解全身 VLA 的分层架构如何落地。
Skild AI 宣布完成 14 亿美元 C 轮融资,由软银领投,NVentures(NVIDIA)、Macquarie Capital 和 Jeff Bezos 等参投,公司估值超过 140 亿美元。
推荐理由:融资规模、估值和投资方名单完整,可作为观察通用机器人基础模型资本集中度的一个参考样本。
Skild AI 提出 Omni-bodied Learning,让机器人模型仅通过观看人类视频演示即可学习新技能,只需不到 1 小时的机器人数据微调。该方法针对遥操作数据在多样性与规模上的瓶颈,以及视频缺少力/力矩信号和人机形态差异(Embodiment Gap)等挑战,旨在让基础模型的任务学习具备可扩展性。
逐际动力正式发布面向物理世界的具身 Agentic OS 系统 LimX COSA,通过高阶认知与全身运控深度融合,实现大小脑一体化智能,全尺寸人形机器人 Oli 在该系统驱动下成为兼具运动智能和高阶认知的人形智能体。COSA 采用自底向上三层结构,底层为全身运控基础模型,中层为可组合调度的高阶技能层,顶层负责交互、记忆与思考,支持自然语言任务拆解、语义记忆与基于实时感知的全身移动操作。
推荐理由:原文给出 COSA 的三层架构与技能调度设计,可作为大小脑一体化系统化构建的参考。
逐际动力发布多形态具身机器人 TRON 2,售价 4.98 万元起,即日起开放预订。TRON 2 采用全身模块化架构,一个本体可快速切换双臂、双足、双轮足三种构型,并支持人形、四足等形态重构。
推荐理由:原文给出构型切换方式、双臂自由度与负载、续航等参数,可据此评估该平台是否适合 VLA 科研与移动操作实验。
Dexterity 提出 Transactable World Models,把空间理解建模为受物理约束的共享算子,供多个机器人 agent 以事务方式交互,提供显式不确定性边界、回滚能力、可解释性与实时一致性。
Figure 发布第三代人形机器人 Figure 03,围绕 Helix、家庭场景和大规模制造完成软硬件重新设计。新视觉系统帧率翻倍、延迟降至四分之一、单相机视场角扩大 60%,手掌内置相机,指尖触觉传感器可感知 3 克压力,并支持 10 Gbps mmWave 数据回传。
推荐理由:原文给出感知、触觉、电池与产线的具体改动和产能目标,可据此评估人形机器人从原型走向量产的工程取舍。
南方科技大学CLEAR Lab联合逐际动力、香港大学的论文《Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-top Manipulation》入选CoRL 2025,提出GVF-TAPE算法,让机器人通过观看操作视频预测任务执行过程并学会自主操作。
推荐理由:论文给出LIBERO基准成功率与实机任务结果,可看出纯RGB视频驱动操作训练相比依赖深度相机和动作标注方法的差距。