MagServo:基于学习隐式表征的抗不确定性分层磁导航伺服框架
MagServo 提出一种分层学习框架,直接利用学习到的隐式磁特征实现鲁棒的 6-DoF 磁伺服控制,无需解析磁模型或显式 Jacobian 监督。该框架通过掩码重建学习抗不确定性磁表征,并结合非线性模型预测控制与局部 Jacobian 求逆的分层控制器。物理实验实现 0.386 mm 与 0.479 度的平均终端误差,并在未见过的磁源配置下无需重训练即保持鲁棒性能。
MagServo 提出一种分层学习框架,直接利用学习到的隐式磁特征实现鲁棒的 6-DoF 磁伺服控制,无需解析磁模型或显式 Jacobian 监督。该框架通过掩码重建学习抗不确定性磁表征,并结合非线性模型预测控制与局部 Jacobian 求逆的分层控制器。物理实验实现 0.386 mm 与 0.479 度的平均终端误差,并在未见过的磁源配置下无需重训练即保持鲁棒性能。
Recon2Servo 提出一种从 B-mode 图像直接学习图像到运动推断的视觉伺服框架,实现超声探头 6-DoF 控制。框架采用带低秩适配的 DINOv3 编码器与双向关系模块估计当前与目标图像间的探头相对位姿,结合监督相对位姿学习、重建引导闭环自适应与有界残差位姿修正。在公开数据集及 12 名健康志愿者采集的内部数据集上验证了重建体伺服效果,并在人体前臂演示目标视图对齐与动态跟踪。
P3 提出一种基于序列蒙特卡洛的扩散控制框架,在重规划步骤间维护加权候选轨迹群体,通过约束感知加权与重采样在不重训扩散模型的前提下满足测试时约束。理论分析表明重加噪深度控制已保留轨迹的路线稳定性,且保留稀有分离路线所需粒子数远少于从头采样。在迷宫导航任务中,P3 相比重新生成群体或约束优化修正单条采样轨迹的方法规划更快,减少路线切换并提升成功率,且每次重规划所需去噪迭代更少。
研究者在 MuJoCo 中为 Multi-Modal Infant Model(MIMo)扩展了具身照护者模型,可参数化自人体测量数据或按录制的照护者调整尺寸,并支持回放自然的抱持与安抚互动。
该研究系统分析了图像增强对 VLA 后训练的影响,发现在 RL 更新中只增强 critic 模块、同时让 actor 在 rollout 和更新时保持干净输入最关键。
研究提出一种位置感知的状态调度模型,将机器人准入与搬运人员支持、共享电梯、充电和清洁资源耦合,并回放 33,079 条医院配送请求进行评估。在高人力配置场景下,将假设电梯容量从 2 提升到 4,纯人工调度的延迟率从 55.11% 降至 3.18%,超过调度策略差异带来的影响。结果表明机器人通过截止时间准入测试仍可能因人员交接和共享设施延误服务,分析区分了准入、完成与恢复可用三个阶段。
ARISE 框架在 Sophia 人形机器人上打通社会推理与具身表达,整合多模态上下文理解、长期记忆及反应式与主动式交互,将社会意图转化为与语音和机械面部表情协同的机器人原生手势。流式执行在 Sophia 上的评测显示交互质量与具身行为协调性良好,并显著降低时延。
Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。
推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。
该研究提出分层强化学习(HRL)框架,让欠驱动双足机器人在避障时保持平衡:高层策略基于机器人姿态、36 路 raycast 接近测量、移动障碍物状态与滚动时域局部目标,每 10 个控制步输出机体速度指令,底层策略以 PD 关节目标跟踪指令,两者用 Soft Actor-Critic(SAC)联合训练。
该研究为机器人超声提出一种双速率力-图像控制器,通过闭式姿态速率上限约束旋转引起的估计接触力偏移,上限取决于局部接触刚度、力环增益、旋转-力增益界、偏移预算与预测时域。
提出 PAMORT 多目标强化学习方法,让四足机器人在无专用负载传感器与主动承载机构的躯干安装无边板上运输无固定堆叠纸箱。该方法以偏好向量加权运动与负载稳定性奖励训练基础策略,再训练权重调节器依据本体感觉在线调整偏好,仿真中对未见过的三箱堆叠也取得与单目标基线相当或更优的运输成功率。
研究测试 VLA 安全监视器能否识别"任务无害但动机有害"的指令,发现 π0.5 在各种意图显式程度下均照常完成任务,与无害对照组无异。文本守卫几乎能拦下直白请求,却漏掉隐含危害:最高 95% 的隐含危害运行完成任务且未触发告警,重新校准后仍达 90%。监控模型激活也未能弥合差距,线性探针在基础语言与视觉-语言模型中近乎完美区分有害指令,但经机器人训练后该分离度在两个模型族中减弱。
该规划器面向带倒挡的类车车辆,让优化每个迭代精确满足离散动力学并保证整车矩形在采样点之间不侵入障碍物,每个时间区间用一个凸走廊约束所有车角并以扫掠余量收缩。在 820 个基准用例中成功 818 个且无穿透(797 个来自首个初始猜测),7103 个优化迭代全部可用,当 99% 初始猜测与障碍物相交时成功率 96.5%。其机动中位时长比同类认证精确碰撞基线长 0.7%,保证仅适用于规划模型而非实车。
研究者提出 DASH,一种把 da Vinci Classic 与 Xi 手术器械适配到通用串联机械臂和人形机器人的适配器,无需改装器械本体。两类适配器兼容多种机器人负载能力,通过器械原生卡扣固定,并无线识别插入的工具以加载对应运动学与耦合矩阵。遥操作实验证实 DASH 可行,为手术机器人研究提供更易获取的平台。
论文提出 Bilinear Flow Policy(BFP),一种面向目标条件模仿学习的生成式视觉运动策略,通过检索锚点训练样本并把未见观测-目标对分解为锚点加残差,再用双线性条件流建模多模态动作分布,以解决目标超出演示分布时的分布外推问题。
Hybrid DeepSEE(HDS)提出一种人在环(HITL)神经符号框架,用于 Visual SLAM 的主动漂移预判,将神经漂移风险估计与符号约束推理结合。框架利用 LLM 作为推理桥梁,把定性人类上下文转化为可解释的符号约束,以缓解数据驱动模型在 OOD 环境下输出物理不一致的问题。该方法旨在提升 Visual SLAM 的可靠性与一致性。
论文提出离线方法 PHRetune,为冻结的操作策略直接推导下游阻抗控制器的刚度与阻尼增益,无需评估回放或增益搜索。该方法从演示数据学习端口哈密顿模型,估算策略预测动作对应的 effort 与 energy 预算,并据此闭式求解单一增益缩放系数,在评估前固定增益,且不依赖机械臂模型、任务奖励、策略重训练或额外运行时计算。
提出 The Unexpired Plan,用分块策略尚未过期的上一段规划作为免费统计量,为免训练加速的扩散策略提供监视器,在 114 种加速配置和四个策略族上以闭环成功率定价。相比每次拒绝后重新武装的门控,吸收式响应仅损失 1 分,将单次调用计算量削减 1.55–3.09 倍。在接触密集的第五个策略族上,无监视器方案均无法守住 ±2 分边界,带监视器方案可以。
FreeSpeed 是一种免训练模块,对预训练策略输出的动作块按请求速率重采样,并以相邻动作的方向不一致度作为信号自适应缩放步长,从而在保持任务成功率的前提下在线调节执行速度。在三个策略族、50 个仿真任务上,保持各任务成功率的设置中实际执行速率为 0.22x 到 2.53x;在四个真实操作任务上平均成功率 94.0%,与冻结策略的 93.8% 相当,实际执行速率为 0.38x 到 1.97x。
论文提出 JESSI(JAX-based E2E Safe Social Interpretable navigation),一个轻量级端到端强化学习框架,将原始 LiDAR 扫描直接映射为运动学可行的控制指令。
Seonghoon Yu 等人提出 RACE(Reliable Action-Chunk Extension)框架,通过辅助的一步去噪预测子技能切换时机,并以此条件化动作生成,降低长动作块在子技能过渡处的误差。
研究提出六种虚拟模型设计方法,用于力控机械臂在含障碍与不确定性的环境中完成抓取任务。在一台力控 8 自由度人形机器人上开展三项实验,测试可预测性、对外力的敏感度以及对已知和未知障碍的适应性。结果显示该方法虽牺牲精度与轨迹最优性,但能以直观、可扩展的方式设计复杂抓取动作。
GenAIF 用单一生成式轨迹模型从演示与动作干预中学习,同时提供目标条件策略分布与状态到观测的似然映射。
研究提出 OCLO,一种不依赖人体运动数据、仅由两个末端执行器目标指令驱动的人形 loco-manipulation 系统,通过解析可达性先验在线生成骨盆高度与躯干姿态,并用 policy-in-the-loop 采样精修。
研究提出用遥操作单机器人演示数据训练多机器人协同视觉运动推箱策略,以规避集体演示采集难题。在最多 40 台机器人实验中,仅靠被动观察其他机器人操作难以获得有效协同,构成多机器人研究的具体瓶颈。论文 15 页 8 图,已被 CoRL 2026 接收。
研究者提出贝叶斯数据增强框架,与高保真车辆动力学的照片级仿真器集成,迭代重训练停机坪检测 DNN,以着陆性能为目标函数。在不同环境条件与车辆状态的仿真验证中,该框架改善了着陆性能,并使预测着陆结果的置信区间更紧。
研究提出一种基于能量扩散模型组合的航天器交会与近距离操作(RPO)轨迹生成方法,可灵活配置任务约束。针对接近锥、传感器视线等约束分别训练扩散模型,推理时将学习到的能量模型与解析能量场组合以施加约束组合。实验中接近锥与传感器视线模型、接近锥与合成避障模型的组合,约束满足率与单约束模型相差在 1 个百分点以内或更高,无需重训即可适配新约束组合。
FOCUS 提出一种不确定性感知的物体级变化检测与地图维护框架,将半静态记忆维护建模为融合几何似然与 3D Gaussian 地图渲染外观似然的概率推断,用递归三态估计器判定物体为 PERSISTED、REPLACED 或 REMOVED。在含歧义原位替换的 Isaac Sim 仓库基准与真实 TorWIC 数据集上,物体级替换 F1 从 0.20 提升到 0.84,且迁移到真实数据无需手动调参。
研究通过 540 次瓷砖地面随机试验(保留 539 次),在 45、55、65 cm/s 指令接近速度下评估差速移动机器人的 5 种制动与转向机动。结果显示,反向旋转机动的编码器航向误差随速度从最低升至最高增加 4.7-5.1 度,而弧线与制动辅助枢转变化小于 0.4 度,陀螺仪误差在反向旋转中约 3 度。编码器误差越大,避障成功率越低,研究据此给出 90% 成功率的估计反应距离。
一篇自动驾驶研究论文总结了开发和部署灵活多传感器数据采集平台时遇到的挑战与经验,涵盖机械设计、传感器标定、电源管理和时间同步等共性问题。团队采用 GNSS 授时与 NTP 协议实现系统级时间同步,并针对不同传感器配置编写自定义标定流程,以提升外场部署的可靠性与数据完整性。论文旨在为新建多传感器系统的研究团队提供参考,增强自动驾驶测试的可复现性与鲁棒性。
TacGELLO 利用 3D 打印主手已有的舵机,在夹爪扳机处提供触觉接触反馈,并在臂关节处提供基于电流的负载提示。AnySkin 接触检测触发扳机位置保持,跟随臂关节电流变化调整主手舵机输出限值以在抬升时产生阻力。在一名操作者完成的 6 次 UR3 会话中,发送指令跟踪误差为 0.15–0.36° RMSE,轨迹滞后 82–98 ms,62 个抓取区间中有 60 个记录到触觉触发。
GR-LIO 提出一种滤波式局部地面感知 LiDAR-惯性里程计框架,将局部地面平面以机器人姿态和机身-地面(B-G)高度参数化并随状态估计持续传播,用于高效地面分割与点到面约束更新。系统引入平面运动更新抑制垂直漂移,并提供 B-G 高度初始化与在线标定流程。在公开基准与自采真实数据集上,GR-LIO 在定位精度和计算效率上均优于代表性 LIO 方法。
提出一种可认证的在线学习增强鲁棒自适应控制屏障函数,用 Neural ODE 适应未知时变模型扰动,并以 conformal prediction 量化自适应不确定性。在适定 Lipschitz 光滑性假设下,该方法在概率界内提供可证明的安全保证,不确定性高时采取保守策略,随数据增多降低控制器保守性,适用于载荷或风扰等模型扰动下的机器人系统。
研究者在 NVIDIA Jetson AGX Orin 上提出一套实时、失效模式感知的多模态可通行性建图流程,以 LiDAR 几何为主、单目语义为按类别与置信度门控的修正信号,纠正湿泥、积水混凝土与减速带等互补失效模式。
提出 tracker-guided 自训练框架,将合成图像预训练模型适配到无标注真实视频,用于手术机器人器械跟踪。不确定性感知 EKF 结合关键点、轴边界与 mask 线索递归修正器械位姿,RTS 平滑器细化轨迹并生成伪标签微调特征检测器。真实视频实验显示自训练在所有关键点指标上一致提升,精度与运行时均优于既有方法,代码与数据将在发表后发布。
FLEX-WAM 提出一种灵活高效的块因果世界-动作模型(World-Action Model),支持可变长度上下文、非因果预测时域以及逐帧或逐块的无限自回归生成。
研究者提出一种基于社会力的导览机器人导航模型,将障碍物、用户位置与朝向等因素纳入力的计算,使机器人对用户更"社会化"。实验中用户跟随自主机器人在已知地图中前往目的地,中途执行简单子任务作为干扰,并与 A* 最短路径基线对比。研究通过可跟随性、感知安全与感知智能等主观指标评估各力项的效果。
EvoMem-VLA 通过显式编码并保留历史状态间的变化来构建状态演化记忆,使策略能跟踪超出孤立快照的任务进展。
RMMBench 提出一个统一框架,将高低层级具身任务整合为"导航-操作"任务套件,覆盖 70 个典型任务场景,从局部操作延伸到长时程复合导航,用于评估 VLM 在连续空间中理解语言指令并执行长时程任务的能力。评测结果显示,领先 VLM 在移动操作任务的空间定位上仍面临重大挑战,凸显长时程交互中增强机器人空间感知能力的必要性。该基准已被 CoRL 2026 接收。
论文提出 TUCO(Trajectory-level Utility and set-level Coverage Optimization),用影响函数追踪每条源演示对目标域评分 rollout 的影响,将其分解为目标回报总体贡献与 rollout 间差异,作为衡量轨迹效用与集合覆盖的统一闭环标准。