统一运动学表示实现可复用的生物关节力矩估计
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文在两个架构族的四个已发布 checkpoint 上观察到世界模型对动作变化敏感度弱、对已验证失败给出成功样预测,并提出 CureWM 方法:从成功演示构造替代动作、在仿真或硬件中执行验证结果,再用得到的失败与存活成功微调已发布模型。
FlashNeRD 通过并行流式架构、可在任意位置接受接触的编码器,以及与解析求解器对象的双向耦合,解决了 Neural Robot Dynamics (NeRD) 加速有限、仅支持预定义接触点、与被操作对象缺乏双向耦合三个局限。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
一篇被 2026 IEEE/RSJ IROS 空间机器人研讨会接收的论文提出了一种证据驱动的人-智能体-机器人协作架构,用于深空任务中脱离地面支持的异常分诊。该架构将 Agentic AI 作为有状态协调器,通过分诊状态管理器维护假设与证据溯源,并由移动机器人获取局部证据,已在基于 Reachy Mini 和 Innate MARS 移动机器人的硬件在环原型上验证。
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
论文提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练只需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,Ariadne 能从仅状态监督构建可行路径并泛化到未见过的起终点组合;在高维双臂规划上,其表现与轨迹监督方法和经典规划器相当。该论文已被 NeurIPS 2026 接收,代码已开源。
论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。
研究团队提出首个在开放、无约束表面上实现闭环自主液滴导航的机器人平台,采用模型强化学习,仅用 50 至 150 次物理实验(视几何复杂度而定)训练策略,无需仿真或解析模型。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 改造为面向四足机器人城市导航的目标条件版本,通过 goal token 注入局部坐标系子目标并重定义人行道导向的可行驶区域合规性。
论文提出一种基于 Vision-Language Models 的上下文感知自适应喷药框架,让机器人结合作物类型、农药类型和天气数据进行空间推理与喷洒决策,并用基于 Model Predictive Path Integral 控制的轨迹跟踪控制器保证导航与喷洒精度。
一篇 arXiv 综述系统梳理了机器人领域基于因子图与场景图的世界模型如何应对动态环境,围绕表示、构建与更新流程、下游任务利用三方面展开,并重点分析融合两类图的混合模型。综述归纳了常见架构模式,并指出从学习感知到表示层的不确定性传播、动态实体运动可观测性、可扩展的终身维护,以及缺乏数据集与评测协议等开放挑战。全文 34 页,含 7 张表、8 幅图。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
Mecka AI 宣布完成 6000 万美元 B 轮融资,由红杉领投,Nvidia、微软风投基金 M12 等参投;TechCrunch 此前报道该轮融资估值接近 5 亿美元。这家公司成立于 2024 年,付钱让人们穿戴身体传感器、用手机记录做咖啡、修车等日常任务,为机器人训练采集人体动作数据,对标 Scale AI、Mercor、Surge 等为 LLM 供数的数据标注公司。
文章认为自动驾驶能迁移给具身智能的是约50%的技术基建和方法论,但那张时间表不该一起搬。光象科技CEO张涛指出迁移部分落在数据采集、清洗、端到端训练、仿真验证和真机测试流程上,而接触类任务是机器人独有的难点;自变量王潜认为自动驾驶难点在导航和运动,机器人难点在操作,视觉只差几像素的两瓶水在动作层面就是两件事。
推荐理由:原文用50%迁移比例、仿真真机成功率落差和出货量对比,拆解了自动驾驶方法论能给具身智能留下什么、带不走什么。
云深处科技在国庆假期将人形机器人DR02部署到杭州西湖区交通路口和景区周边,在雨天环境中进行值守、语音引导游客、识别越线电动车等测试。DR02身高180厘米、31个自由度、IP66防水防尘、搭载275TOPS AI主机,此前已在变电站完成作业测试。
全国具身智能机器人生态发展暨产教融合创新大会将于10月20日至21日在长三角国家技术创新中心(南京江北新区)举行,作为2026物理AI与世界模型大会主要内容之一。大会将启动全国具身智能机器人产教融合联盟成立仪式,宇树科技、科大讯飞、集萃智造联合数百所高校共建,并启动《具身智能算力国家标准》编制。预计参会规模约260人,涵盖南京大学、河海大学等高校专家与产业链企业代表。
9月15日arXiv出现论文《BRIDGE:An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI》,Skild AI两位创始人参与创作,展示了一台高88厘米、13公斤的开源人形平台,硬件图纸、控制策略、训练脚本全部公开。
推荐理由:文章梳理了Skild AI从卖大脑到开源参考身体的路径,并与宇树、智源的同类做法对比,便于理解接口之争。
NVIDIA 教会机器人组装 GB300 测试托盘,并从中获得关于机器人学习、机械智能与传统工程的启示。NVIDIA Grace Blackwell GB300 超级芯片是现代基础模型 AI 训练与推理的引擎,但其托盘组装目前仍需全球各地工厂中的熟练体力劳动。
IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。
推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。
Harmonic Drive 应用工程师 Marcel Almonte 将在 RoboBusiness 2026 发表演讲,介绍集成驱动执行器设计如何通过简化系统集成、减少布线复杂度、缩短测试与调试时间来降低工程工作量。
EmbodiedSmith 提出一个通过递归自我改进(RSI)生成可扩展具身数据的框架,将资产、场景与任务生成统一到同一流水线中,支持自主创建与语言驱动定制。其核心是智能体式精修回路,场景生成预判下游任务需求,任务生成反过来引导场景编辑,使两者迭代互促,提升任务生成成功率,包括长时程任务;框架还支持移动机械臂、人形机器人与灵巧手,以及可形变物体和流体交互。
论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。
一篇 arXiv 论文提出了一种用于 Signal Temporal Logic(STL)控制综合的几何判定方法,将时序约束转化为时间零点处的连续空间后向可达集,可行性判定与时间视界长度完全无关。
PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。
推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。
论文提出从 DINO 残差中学习的残差潜在动作(RLA)表示,并据此构建 RLA World Model(RLA-WM),通过 flow matching 预测 RLA 值,在仿真与真实数据集上超过现有特征式与视频扩散世界模型,速度比视频扩散快若干数量级。
HARL-A 是一个基于 IsaacLab 的开源框架,支持在高保真物理仿真中对形态各异的机器人团队进行可扩展的对抗策略训练与基准评测,团队数量和每队机器人形态组合均可任意配置。该框架扩展了 HARL 算法库,贡献了模块化软件架构、Sumo/Soccer/3D Galaga 三个基准环境,以及超过十个预训练策略,已在 Hugging Face 公开发布,演示中可稳定产生对抗策略与涌现的角色分工。
KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。
研究提出 Completion Aware Guidance(CAG),一种无需训练的采样方法,将 World Action Models 的生成引导向任务完成。在 RoboTwin 2.0 子集上成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,任务未完成想象比例从 79% 降至 40%。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。
一项机器人学研究提出统一的自回归扩散图生成模型,联合学习图结构与空间节点特征,从观测到的垂直平面自底向上构建任意层级深度的完整 3D 场景图(3DSG)。该方法在涵盖合成场景、真实建筑平面图与机器人传感器数据的 3DSG 数据集上,一致超越所有基于学习的基线与随机基线,并在最大层级与真实单层数据上超过可获取目标图规模的一次性模型。
论文提出 VLAct,一种面向 Vision-Language-Action 模型的 VLM 骨干,在任务微调前于多本体机器人数据上继续预训练,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨本体动作布局来保留通用视觉先验并共享动作语义。
VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。
PhysCaP 提出一种面向机器人操作主动感知的 Physics-Informed Code-as-Policy 智能体系统,通过免训练的物理属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,无需额外传感器。
一篇 IROS 2026 Workshop Spotlight 论文提出将接触模式视为位形空间的分层(stratum),把规划建模为在分层间行走、分层内沿测地线运动的过程。在两项仿真任务(推动 T 形方块绕障、灵巧手中重定向立方体)中,该规划器无需预先给定模式、接触序列或分层,可在数秒内返回解。
论文提出 Model-Based Diffusion Optimal Control(MDOC),一种基于模型的扩散规划器,无需依赖演示数据即可高效生成动力学可行轨迹。
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。