HuMBLE:基于人体运动数据的人形机器人步态行为学习框架
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
论文提出 Agentic Real-to-Sim-to-Real(Agentic RSR)框架,把场景重建、策略开发与真机执行通过同一操作任务串联起来:给定工作空间视频、任务描述和已知机器人模型,智能体恢复度量尺度、用视觉反馈迭代细化场景并在 MuJoCo 中检查任务相关交互,再由编码智能体从特权物体位姿逐步过渡到视觉观测和随机化仿真,生成可执行策略。
一项研究提出基于释放状态的模型化框架,让 6-DoF 机械臂投出能飞回的回旋镖,据称是首个实现回旋镖返回飞行的机器人机械臂。演示中回旋镖以 51 rad/s(8.1 rev/s)释放,飞至距基座 2.03 m 处并落回 0.31 m 内。成功释放与实测人类投掷差异显著,表明机器人无需模仿人类动作即可实现返回飞行。
论文提出感知辅助的高度自适应规划框架CMP-IRRT*,即Channel Mamba PointNet引导的Informed RRT*规划器,用于四足机器人穿越低矮障碍。
论文提出 LLA-MPPI(Look-back and Look-ahead Adaptive Model Predictive Path Integral control),把全身自适应转化为在一组 GPU 批量接触仿真器(物理或结构参数不同)上的选择,用窗口化预测误差选出最能解释近期运动的模型,再由全身 MPPI 规划器在该模型上优化控制,无需离线训练且所选假设物理可解释。
FoldBack 是一种面向长程衣物折叠的自纠错掩码生成策略,围绕三个推理时决策构建恢复机制:何时精修与验证、如何回滚、以及在何处及如何重试。它将精修与抓取校验对齐到 pick-and-place 事件,把机器人退回可重试的预抓取构型并保留成功抓取,选择性重新生成失败片段及部分后续动作,同时避开此前失败的抓取位置,无需恢复演示或基策略重训。
RFPO 是一个面向连续机器人控制的流策略优化框架,用 Reward-aware 在线 Reflow 修正学生策略的传输路径,并以冻结的 Gaussian PPO 控制器在完整与中间积分预算下提供动作空间监督,使部署策略只需单步 Euler 积分即可执行。
AirGroundVLN 提出面向目标导向空地协同视觉语言导航(VLN)的大规模基准,包含 19 个 Unreal Engine 环境中的 10,281 个导航片段与 955 个目标实例,设有 seen/unseen 划分与 aerial-visibility 协议。
研究团队推出 RobotWorld,一个面向机器人任务的仿真测试基准,将指令与观测转化为物理任务执行。其 84 项任务覆盖操作、移动操作、运动、驾驶与空中控制,设有显式交互预算与可执行成功判定。
论文提出 RoboQuest 基准,用于评估智能体通过物理交互主动获取任务相关信息、据此调整后续动作并自主判断何时完成任务的能力。该基准包含十项移动操作任务,围绕搜索、基于操作的检查和交互式测试三类不确定性构建;作者通过统一视觉运动接口评测五个前沿多模态智能体,并测试了在完整轨迹演示上微调的 π0.5 策略。
NeRFifyMesh 提出一条将现有带纹理 Mesh 模型转换为 NeRF 表示的新流水线,通过采样 Mesh 几何与纹理人工生成基于点的真值辐射场,无需基于相机的采样或多视图图像渲染即可训练 NeRF。基准测试显示其渲染质量与基线方法相当,并演示了构建统一 NeRF 场景与基于提取几何的碰撞仿真,论文已被 IROS2026 接收。
论文提出OpenViTac,一个跨仿真与真实世界的视触觉机器人操作基准,将接触密集型操作归纳为四个触觉相关能力维度,并提供配对的仿真-真机设置,用于一致评测VLA、WAM和VTLA策略。
一项研究在 CogniPlan 数据集中插入门诱导的歧义,对比纯几何模型与增加门语义通道的模型,发现门区域 L1 误差从 0.004342 降至 0.000025,F1 与 IoU 从 0.031311 和 0.015905 提升至 1.000000。全图性能两者相近,表明语义线索可改善几何观测歧义区域的预测占据补全。该成果已被 IEEE TENCON 2026 接收。
MultiFly 提供 17,272 个同步样本,覆盖 RGB、热成像、LiDAR 和 radar 四种模态,来自 4 个郊区场景,含 15 个语义类的逐帧标注以及标定和 GNSS-RTK/IMU 数据。
研究团队提出一种基于霍尔效应的紧凑型力传感器,含3个毫米级感应单元(taxel),可贴装于机器人手术工具抓取面,用于补偿微创手术中的触觉反馈缺失。传感器将霍尔效应传感器与磁体嵌入可变形弹性体接触层实现小型化,经6自由度(DoF)并联机器人标定,每个taxel检测法向与剪切力的平均RMSE为2.133 kPa。标定后的传感器在仿体与离体猪组织上完成验证,可感知牵拉过程中的触觉与滑动。
论文提出分层强化学习框架,将高频关节级运动执行与低频步态适应分离,后者显式最小化运输成本 CoT,并通过三阶段 Isaac 训练实现零样本 sim-to-real 迁移。
论文系统研究高分辨率动态触觉传感对灵巧机械手抓握稳定性预测的作用,采集了覆盖 200 个物体、共 10,000 次抓握试验的数据集,每只多指手配备四个 Digit 360 触觉传感器,同步记录视觉、本体感觉与触觉流。
一项机器人研究提出控制感知布局修复方法,从结构化任务记录出发,将全程跟踪、间隙与驱动要求编译为可审计的仿射布局约束,仅修复声明的连续坐标,保留事件顺序、时序、拓扑与控制器不变。在三个研究者编写的任务抽象上,两种后端均通过全部三个布局的认证,并完成每个后端 300 次全新配对 rollout。风险目标扫描还暴露出仅靠布局编辑无法满足的固定事件测试。
一篇 arXiv 论文提出一种全驱动 4-DOF 机械手指,采用关节专用的混合远程驱动架构:MCP 关节由两组刚性连杆传动驱动,PIP 与 DIP 关节由闭合环路钢丝传动独立驱动并引入滚动接触关节(RCJ)。实验用 ArUco 标记跟踪测量滚珠丝杠位移,验证了远端传动的机械解耦;孤立驱动 MCP、PIP、DIP 时指尖平均峰值力分别为 21.28 N、9.22 N、5.75 N。
论文对 π0.5 和 GR00T N1.7 两个 VLA 模型的语言接地能力开展机制可解释性研究,对其动作生成模块残差流施加 activation 与 attribution patching,并按同义替换、语义缩放、方向性破坏、随机物体替换、空字符串五种策略系统扰动 LIBERO 基准的任务指令。
论文提出 LiSoNav-COL 任务,要求机器人在空场景记忆起步、持续寻找被移动的小物体,并发布覆盖 28 个室内场景、45 类小物体的基准 LiSoNav-Eval,其导航序列包含未变动与已重定位目标以评测记忆复用与适应能力。同时提出基于多视角观察与视角锚定记忆的导航方法 IVAM-Nav,实验显示其优于代表性方法;基准分析表明物体越小、环境越大、重定位距离越长挑战越大,数据集与代码已公开。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
一篇 arXiv cs.RO 论文提出基于 Model Predictive Control (MPC) 的分布式控制器,用于高效执行基于 braid 的拓扑约束。
Video-to-Model 框架可从输入视频自动建模可变形缝合线的运动:感知模块定位并跟踪缝合线,时空 CNN 网络估计结构化 CBF-CLF-QP 模型的有效参数,再在用户定义的针头速度输入下仿真缝合线。在未见过的缝合线构型与运动上的实验表明,该框架能可靠重建缝合线行为、自动配置模型并以低跟踪误差复现预期运动,减少手动调参需求。
论文提出仅依靠软光学触觉传感在线估计接触力与可能时变任务帧的方法,用于混合力/运动控制,假设局部平面接触且接触力矩可忽略。该方法将弹性体单帧形变图像映射为压入深度、两个相对传感器倾斜角和3D接触力,每个量附带逐样本不确定性估计;映射通过自标注流程学习,由机械臂施加受控接触并用辅助Force/Torque传感器离线提供真值标签。
研究团队构建了配备人工肌肉、多模态传感器和强化学习训练的神经网络控制器的机器人运动系统类比模型,实现了精准运动与损伤鲁棒性,并复现出类似动物的神经群体动力学。研究发现神经旋转会产生垂直于抓取方向的振荡机动以优化轨迹调整,该结论经灵长类神经数据验证,同时揭示了传感器与运动冗余下的反直觉神经能量原则。
论文提出一套视觉系统,由带臂载相机的四足机器人对 nano-UAV 进行定位:四足跟踪无人机,用分割掩码与深度估计其在自身坐标系中的位置,并通过实时无线电链路发送。
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
论文提出 MILD 操作接口定位数据集与 AprilVINS 定位方法,用于 UMI 式机器人操作示教中的末端执行器定位。MILD 真实子集包含 Insta360 X5 与 Insight9 采集的 86 段传感器序列、15 项重复桌面任务及每次执行的机器人末端参考轨迹,仿真子集 MILD-Sim 在 Isaac Sim 中扩展任务覆盖。
论文提出一种紧凑型移动机器人,用折纸结构轮实现移动并主动调节传感几何:轮子在地形自适应构型间切换时底盘俯仰带动 2D LiDAR 扫过不同高度,IMU 提供姿态,融合节点将 LiDAR 点云投影进 RTAB-Map 的 RGB-D 深度流。
研究提出一种端到端方法,仅输入网格装配体即可自动生成逐步装配手册或结构化失败报告,无需关节元数据或紧固件标注。该方法自主完成装配工具清单、装配顺序与子装配、装配手册及可装配性设计反馈四项内容,其中顺序规划通过在物理仿真器中系统性拆解物体并应用编码DfA原则的成本函数实现。
论文提出一套端到端自主流水线,用于定制木质装配体的设计与物理构建,生成式 AI 代理将用户提示转为初始 3D 几何,并通过图注意力网络代理的梯度修复阶段反向传播调整组件几何。该方法在 60 条新颖自然语言输入上使机器人拧螺丝成功率达 86.7%,显著优于先前工作十倍,并用两台 UR5e 机器人对其中十个结构完成了物理可装配性演示。
AeroEval 是一个代理辅助中间件,对 LLM 生成的无人机任务做分阶段校验,先验证程序语法、平台 API 用法与任务意图,再结合执行轨迹、任务需求和环境上下文评估实际行为,每阶段返回结构化失败信息用于迭代重生成。
论文提出 ΔWAM,通过动作切线场(Action Tangent Fields)对动作如何诱导未来动力学变化做局部 Taylor 展开,把世界监督重新表述为与动作紧密耦合的一阶结构,并蒸馏进 WAM 的去噪监督。
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。
论文提出 RoboPace,一个面向动作块策略的在线重定时层,在保留策略几何路径的前提下按预测接触调整执行速度,同时兼顾接触相关速度限制与机器人运动学、动力学约束,无需重训练策略即可实时运行。在双臂机器人的三个接触丰富任务上,快速均匀执行和仅按物理限速的重定时大多失败,而 RoboPace 的整体成功率高于慢速均匀执行,并在约一半时间内完成五条指令中的四条。
论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。
论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。
一项研究提出面向腱驱动机械臂的多目标优化方法,用 NSGA-II 同时最大化关节扭矩并最小化臂厚,优化肌腱走线、滑轮配置与附着点。结果得到 Pareto 最优设计,通过策略性捷径有效扩大等效力臂,为紧凑高扭矩机械臂提供设计指南,其优化构型呈现超出常规设计直觉的非平凡规律。该论文已被 Advanced Robotics 接收。