RoboIRS:面向通用机器人策略的推理时内部表征引导方法
RoboIRS 是一种推理时内部表征引导方法,利用成功与失败的 rollout 训练线性分类器、选择与结果相关的干预位置并推导任务特定的引导方向,无需更新策略参数。
RoboIRS 是一种推理时内部表征引导方法,利用成功与失败的 rollout 训练线性分类器、选择与结果相关的干预位置并推导任务特定的引导方向,无需更新策略参数。
PerturBot 通过任务保持的腕部视角扰动、决策相关字幕增强指令,以及随机与失败轨迹片段重标注,削弱视觉-语言-动作(VLA)策略对模态捷径的依赖,且不改变推理过程。配套提出的 GroundingFscore 是一种离线评分,用于诊断策略对模态捷径的依赖程度,与任务成功率结合可判断策略是否健康扩展。
Zhe Tao 等提出 ForeAct3D,用可学习几何查询从策略表示解码深度、语义分割与相机位姿,并以策略生成的 action chunk 条件化未来查询,把未来预测锚定到计划动作上。
DreamFormer 提出一种基于模型的智能体,先从无结构玩耍数据学习任务无关的 Transformer 世界模型,再在隐空间想象中通过内在奖励对齐专家演示来习得语言条件的多任务操作技能。
WasserMan 是首个面向浮基水下接触操作视动学习的多任务仿真基准,提供 10 个专家可解任务、2 个载体-机械臂平台、双臂构型与水下动力学,其中 9 个任务支持已学习策略评测。
AgenticTactileVLA 提出一种执行期监督器,用手指位置和电机力反馈作为本体接触证据,在不使用触觉传感器、不重训练 VLA 的前提下修正抓取实现。
FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。
GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。
TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。
推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。
TACET 提出一种上下文自适应声学-社会导航方法,让四足机器人从第一人称视角推断社会场景,同时决定行走位置与移动音量。该方法用单一行为 token 耦合微调视觉-语言推理器与快速反应控制器,同时约束社会代价地图与安静运动策略,并以视野外记忆保留离开相机视野的行人。
SUAVE 提出一种单一词表的统一 Action-Video 模型,用 masked diffusion transformer 在共享序列中以离散 token 表示视频、动作与语言,通过推理时选择掩码位置即可切换为世界模型、机器人策略或视频-动作模型。
Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。
REDIRECT 仅用 1% 的全训练样本反向预算,即可修复机器人从少量缺陷遥操作演示中学到的坏习惯,无需帧级标注或额外交互。在三个 ManiSkill 随机化任务上,REDIRECT 将平均成功率从 68.2% 提升至 90.3%,恢复 88.8% 的干净重训练差距,而同算力微调仅恢复 22.1%。在 PiPER 机械臂的杯子插入与毛巾折叠任务上,它恢复 86.7-92.9% 的差距。
GOTT 提出 reach-acquire-move 框架,用单一跨具身接触获取原语把机器人无关的物体轨迹转化为多指手行为:先将手带到任务相关接触区域,再由共享闭环原语建立稳定接触,位姿条件控制器跟踪物体运动。仿真与真实实验显示 GOTT 能在多种物体、臂-手平台及已见与未见手部形态上建立鲁棒接触,并一致提升端到端任务成功率。
论文提出 KL-Regularized Policy Optimization(KLPO),将 KL 正则锚定在采样器上,通过最小二乘拟合采样器自身轨迹的 log-ratio 最优性条件,无需重要性权重即可完成策略更新。
研究团队提出 ProactiveCoach 套件,包含训练集 ProactiveCoach-Instruct、评测集 ProactiveCoachBench 与自适应引导系统,在阶段、步骤、动作三个层级提供结构化引导数据。
东京初创公司MW把沿天花板轨道滑动的双臂机械臂MW bot集成进住宅,首批不含机器人版本定价2亿~4亿日元,已在东京、横滨、福冈推进项目,搭载机器人的版本计划2028年上市。
推荐理由:文章拆解了MW把机械臂集成进住宅的路线选择,以及它与双足人形方案在安全、算力和心理感受上的取舍。
PrisMem 提出能力驱动的智能体记忆自进化方法,通过依赖感知的能力选择与历史引导诊断来优化记忆程序,并在 BEAM-1M 和 LongMemEval-M 上分别以 10.54 和 7.83 个百分点的优势超过最强基线。
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
波士顿动力为新一代 Atlas 发布四指灵巧手,共 13 个自由度、直接驱动,尺寸接近大型人手且平均力量更强,可搬运装满 100lb+ 的小冰箱。手部配备覆盖指尖和掌面的密集压力触觉传感器,关节可反向驱动以实现本体感知,支持捏取、三指抓握和握持电钻、射钉枪、焊枪等带扳机工具。
推荐理由:原文解释了四指 13 自由度设计如何在灵巧性、强度与量产成本之间取舍,可为同类末端执行器选型提供参考。
Destro AI 走出隐身模式并完成 $8M 种子轮,由 Base10 Partners 和 Bonfire Ventures 领投。该公司不做机器人本体,而是构建 AI 智能层,同时调度人类工人、料车与卡车。
AMD以约82亿美元全股票交易收购World Labs,李飞飞将加入AMD任执行副总裁兼首席科学家,交易预计2026年底前完成。文章借此梳理国内世界模型的三条路线:腾讯混元偏空间生成,群核科技偏空间数据与仿真训练,影身智能从多视角真实4D数据切入,经4D重建、世界模型到真机执行闭环。
推荐理由:原文把AMD收购World Labs与国内三条世界模型路线并置,可用来理解4D世界模型从数据到产线的落地差异。
智元与炊具品牌爱仕达合作落地,100台灵犀X2人形机器人进入爱仕达全国100家门店担任促销员,覆盖六十多个城市。双方在温岭、上海、无锡三地开展为期三天、每天10小时的直播,百店累计销售金额达225.3万元,带动门店业绩增长39%。
推荐理由:原文给出三天直播的销售金额与增长比例,并拆解了机器人与真人导购的分工边界,可作为零售部署的验收参照。
Skild AI 宣布通过物理自我对弈完成一项后训练突破,其机器人基础模型 S1 在与自身对弈的仿真中学会了踢足球等高度灵巧和动态的任务。模型只被给出进球这一个目标,在 NVIDIA Isaac Sim 中与近期版本的自己对抗,逐步自行学会带球过人、护球和铲球,这些行为因有助于进球而涌现,未手工设计奖励。
推荐理由:原文给出仿真时长、涌现行为和 sim-to-real 迁移结果,可据此评估自我对弈后训练路线在具身智能上的可行性。
Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。
推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。
机器人安全正从"故障时是否安全"转向"攻击者篡改感知与决策时是否安全",训练后门、系统漏洞与运行时感知操纵构成三层攻击面。NeurIPS 2025 的 BadVLA 针对 VLA 模型植入后门,GoBA 以咖啡杯等日常物品为触发器实现 97% 攻击成功率;UniPwn 利用硬编码密钥与命令注入可"蠕虫式"扩散至整机队。
Skild AI 在首次商业部署十个月后年度经常性收入突破 1 亿美元,其中约 90% 来自操作类任务,移动类占 10%,已积累 60 多家付费客户。公司正与 NVIDIA 和 Foxconn 合作,在双臂机械手上部署 Skild Brain 用于 NVIDIA Blackwell 系统的高精度装配,并在住友电装推进 S1 用于线束制造,与三井物产在商用厨房试点通用机器人。
推荐理由:原文给出十个月60多家付费客户的收入结构与部署案例,可看出具身智能商业化在操作类任务上的落地分布。
Figure AI 发布机器人训练数据集 Index,配套 App 已在 Google Play 与 App Store 上线,累计下载 264,000 次、覆盖 108 个国家,Creator 上传超 1600 万条视频,每秒处理 30 分钟视频上传。
推荐理由:原文披露了每千小时数据的任务与物体多样性指标,以及五阶段数据管线,可作为机器人数据采集规模化的参考。
Skild AI 发布旗舰机器人基础模型 S1,作为上下文学习器,仅凭一段视频演示即可执行未在预训练中出现、最长 10 分钟的操作任务,无需微调或后训练。在内部基准上,未见任务中 ICL 在 100k 小时预训练数据下达到 66% 成功率,语言提示 VLA 为 9%;已见任务中 S1 达到约 96%。一次上下文演示约等于 380 个后训练示例,植物移盆任务从演示到自主执行用时 11 分钟。
推荐理由:原文给出 ICL 与语言提示 VLA 在 1k 到 100k 小时预训练下的成功率对比,可作为评估提示范式选型的参考。
逐际动力随 COSA 0.5 发布 V³-0,即机器人 OS COSA 中 VLA-tools 层的首个版本,支持移动全身操作的人形 VLA 技术栈。V³-0 运行在 43 自由度的人形机器人 Oli 上,多级架构让感知、决策与执行在不同时间尺度协同运行,LimX-WBT 跟踪全身目标并维持动态平衡,统一移动与操作。
推荐理由:原文给出 V³-0 的多级架构与人类在环真机强化学习闭环,可作为人形 VLA 技术栈设计的参考。
逐际动力宣布完成 Pre-IPO 轮融资,融资金额近2亿美元,过去半年累计完成融资4亿美元。本轮投资方包括IDG资本、蓝思科技、GGG Group、华山资本、合肥滨湖产发集团等,阿联酋磊石资本连续追投,绿洲资本、基石资本、蔚来资本等老股东超额加注。
推荐理由:本轮资金用途点出大小脑融合技术产品化与数千台人形机器人规模化部署,可看出其下一步投入重点。
Figure 最新一代人形机器人 Figure 03 已抵达 BMW Group Plant Spartanburg 的 Hall 52,首次在该工厂演示物流排序(sequencing)工作流。
推荐理由:原文给出 Figure 02 去年参与装配 30,000 辆车的基线,可对照理解 Figure 03 从取放到排序任务的升级。
Sanctuary AI 宣布其 Physical AI 在一家全球 Tier 1 汽车供应商的复杂线缆插装任务上达到 99.5%+ 的任务成功率,节拍时间 2.54 秒,并通过客户实际产线基准验证。
推荐理由:原文给出了线缆插装任务的 99.5%+ 成功率与 2.54 秒节拍,可作为柔性物料自动化落地的参考基准。
波士顿动力与现代合作,用人类示范和强化学习训练 Atlas 人形机器人完成此前未见的 Ghost Rabona 花式踢球动作。团队用光学动作捕捉记录球员与工程师 Roberto 的高保真运动数据,经重定向映射到 Atlas 运动学结构后,在云端 GPU 并行数千次仿真训练,相当于 24 小时内完成一年的物理试错,学到的策略几乎全部首次上机即成功。该训练方法可迁移到仓储、工厂等实际作业任务。
Figure 演示两台 Helix-02 人形机器人在两分钟内协作完成卧室整理,包括开门、挂衣服、收耳机、合书、倒垃圾、推椅子和共同铺床。两台机器人共用一个学习得到的 Vision-Language-Action 策略,没有共享规划器、消息传递或中央协调器,各自通过相机读取场景并仅凭动作推断对方意图。
推荐理由:原文给出了双机器人协作的实现方式,即无共享规划器、仅靠各自相机推断对方意图,可作为多智能体操作的参考。
逐际动力正式开源 FluxVLA Engine,一个面向具身智能的标准化 VLA 工程底座,以统一配置、标准接口、模块解耦和加速部署为核心,打通数据处理、模型训练、仿真评测到真机部署全流程。
推荐理由:统一配置与模块解耦的设计思路,对需要在多个数据集和硬件平台间复用 VLA 训练流程的团队有参考价值。
Figure 宣布 BotQ 工厂已交付超过 350 台第三代人形机器人 Figure 03,产量从每天 1 台提升至每小时 1 台,120 天内实现 24 倍吞吐提升。
推荐理由:原文给出 BotQ 产线的节拍、良率和测试数据,可作为人形机器人量产爬坡阶段的一手参考。
Skild AI 宣布收购 Zebra Technologies 的机器人业务部门(前身为 Fetch Robotics),计划把自家 omni-bodied brain 部署到仓储履约流程中。
推荐理由:收购让 Skild Brain 与 Zebra 的 Symmetry Fulfillment 编排平台结合,可看出其在仓储场景落地通用具身模型的路径。