TIGER:面向稀疏奖励桌面机器人操作的任务空间模仿引导强化学习框架
CoRL 2026 收录的 TIGER 框架将动作分块模仿策略作为任务空间进度估计器,把预测动作块经控制器感知的动作-运动映射转为末端执行器参考,为 RL 智能体提供稠密进度奖励,同时保留稀疏环境奖励为主目标。
CoRL 2026 收录的 TIGER 框架将动作分块模仿策略作为任务空间进度估计器,把预测动作块经控制器感知的动作-运动映射转为末端执行器参考,为 RL 智能体提供稠密进度奖励,同时保留稀疏环境奖励为主目标。
ReDex 提出一个框架,将仿真训练的基座策略适配到真实世界,通过纠正局部接触失败并引入触觉反馈来提升灵巧操作表现。在真实硬件上的两项接触密集任务中,相比仿真到真实迁移的基座策略,Object Flipping 成功率从 14% 提升到 86%(两个物体),Screwdriver Rotation 平均进度从 26.0% 提升到 95.3%(三个物体)。
ProCut 提出一个全可微框架,用基于 sigmoid 的连续化方法平滑组织切割的离散事件,并在可微 Position-Based Dynamics(PBD)仿真中结合 Stein Variational Gradient Descent(SVGD)做粒子概率推断,生成多个拓扑状态假设。
MobileVISTA 是一个数据生成框架,把在标准位姿下采集的演示转化为带位姿扰动的训练数据,同时增强自我中心视觉观测并重定向动作以补偿基座位姿变化。
一种风险敏感人群导航框架采用自适应椭球共形预测(AECP)捕捉方向性预测误差,并将结构化不确定性转化为 CVaR 信号调节 Lagrangian 安全惩罚,策略用 Lagrangian proximal policy optimization 优化。
SURGE 提出一种相机-声呐融合框架,在因子图中联合估计 ROV 轨迹与目标位置,再用恢复的度量位姿进行声呐 Gaussian splatting 重建。在真实水下 RGB-声呐观测上的实验显示,SURGE 相比基于视觉的位姿估计方法显著提升定位一致性,并生成比 RGB Gaussian splatting 基线更紧凑、原生带度量尺度的重建结果。
一篇 ICRA 2026 论文提出用一系列刚性连杆替代无质量刚性杆假设,通过 Euler-Newton 推导多无人机吊挂负载系统(MUSLS)的动力学模型,并适配 Featherstone's articulated body algorithm 高效仿真。实机验证显示负载平移平均误差低于 132 mm(绳长的 5.5%),姿态误差低于 11.4 度,作者同时公开了真实飞行数据。
arXiv 论文提出熵门控信念协调(Entropy-Gated Belief Coordination),在多智能体集体熵比超过阈值 θ 时跳过信念融合、仅在开发阶段合并。
RACER 提出面向轮式四足竞速的分层控制框架,将 MPPI 规划器、学习式残差动力学模型与底层 RL 速度跟踪器结合,用神经残差项刻画 RL 策略的闭环跟踪行为。
一款自主、低成本、水射流动力的开源三体机器人船平台发布,开发成本为 $600-1,500 USD(取决于传感系统配置),重量低于 5 kg,最高航速达 2 m/s 并可对岩石等自然障碍物进行避障。
一项面向人形机器人的基准与闭环框架提出语义感知运动与执行感知导航,建模高程图中不明显的危险物与指令执行偏差,并在仿真中评估导航、在 Unitree G1 实体机器人上验证运动策略。结果显示语义输入减少了机器人与高程图难以表征的危险物的接触,抗偏差机制提升了导航成功率。研究指出人形机器人导航需同时评估路线完成度与危险规避。
AeroBuoy 获得 IROS 2025 安全、安保与救援机器人最佳论文奖,该系统由可无人机投放的3D打印自主浮标组成,借助 GPS 与磁力计沿河道自主航行,可测量水温并按需加装溶氧仪、声纳或浊度传感器,已在新西兰奥克兰 Ōrewa River 完成全系统演示。
arXiv 论文提出一个可信物理 AI 框架,将安全性(Safety)、行为可理解性(Behavioral Intelligibility)与感知对齐(Perceptual Alignment)整合到具身、控制、认知与设计四个层面。论文指出,机器人进入人类空间的速度快于我们建立其可信度标准的速度,可信度来自物理能力、可观察行为与用户交互预期的对齐。
arXiv 论文 arXiv:2610.07371 分析了 TCPA、DCPA 与 Velocity Obstacles(VO)在碰撞风险评估中的关系与不确定性行为。
ScanSTL 将关联时间聚合与并行扫描、有序块归约结合,用线性工作量与存储、对数并行深度计算精确时序算子的完整鲁棒性轨迹,并提供支持自动微分、批处理与编译的开源 JAX 实现。
SharedKV-BT 让行为树(BT)的每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并把选中决策交给独立执行系统,在机器人操作、移动导航和 computer-use 三类任务上,类型化决策速度比 prompt 匹配的自回归解码快 2.36-4.15 倍。
一项研究提出完全去中心化的框架,让机器人集群仅凭局部交互构建并动态维护通信网络,无需集中式拓扑规划或全局定位基础设施。形式化分析表明,局部重连操作可保证网络持续连通、每次分支转移严格缩短网络长度,最坏性能被限定在最短星形树之内。仿真与物理多机器人实验显示,该方法形成的网络长度接近集中计算的 Euclidean Steiner 树,并能动态适应移动目标、仅部署必要的连接节点。
论文提出一种乐高式刚度配置方法,通过可堆叠的平面柔顺模块实现面向任务的柔性接口刚度设计,实验验证仿真刚度偏差低于 6.5%。该方法结合遗传算法与序列二次规划两阶段优化,通过梁宽、板厚和模块朝向调节刚度特性。基于该框架开发的柔性腕在 1 m/s 高速运动下保持柔顺避障,最大测试角度柔顺性约 $15^\circ$。
NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。
推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。
arXiv 论文提出面向障碍物切换动态模式的 Safe-Horizon Model Predictive Control(SH-MPC)分布迁移方法,从有限模式观测构建未知类别模式律的置信集,并推导乘性支配界,将碰撞风险证书从选定的场景采样分布迁移到置信集内所有模式律。
一种荧光增强胡须阵列水下传感系统通过局部光学读出实现流源定位,池试平均空间定位误差 88 mm(半径 73.5 mm、角度 2.5°),测试区域 600 mm、±30°。系统由 5 根镍钛合金芯、荧光聚氨酯壳胡须配紫外激发与单目相机构成,用轻量 CNN 从 2 s 序列估计定位,并完成移动推进器的实时定位演示。
四足机器人非抓取物体搬运框架通过不确定性感知轨迹优化与耦合凸模型预测控制器,将物体滑动相比固定朝向基线减少约50%、相比直线基线减少30%,并取得更低的机器人质心跟踪误差。该方法联合预测四足机器人与负载的质心动力学,再由全身QP施加地面反力约束,在物体惯性参数变化下经仿真与真实实验验证。
一种结合 Transformer 神经网络与 Multi-State Constraint Kalman Filter(MSCKF)的单目视觉管线,可在交会与近距离操作中估计未知航天器的位姿,无需目标形状、惯量先验或深度/激光雷达等额外传感。
论文提出 RoboCap,一款 250g、配六相机与双 IMU 的头戴设备,用于野外第一视角机器人操作数据采集,并配套设备无关的 Grounded API 3D 算法套件。
AIM 框架将 real-to-sim 软体仿真建模为局部-全局交互问题,用运动历史与几何自适应调整粒子关系,并通过几何条件化的全局通信协调整体响应。在 PhysTwin 和 PGND 上的实验显示,其未来预测跟踪误差相对 PhysTwin 降低 20.0%,六类物体的长时程粒子平均误差相对 PGND 降低 22.8%。
TeleHairing 提出一套用于假人头机器人理发评估的闭环遥操作架构,支持本地、中继与远程三种部署条件。日志显示远程模式总时延达 190.5 ms,且时延增量主要出现在机器人侧控制端点之前;轨迹分析表明远程指令跟随误差主要来自末端回撤段,剔除该段后 RMSE 从 45.1 mm 降至 9.6 mm。检测丢失试验中 rebase 事件恢复运动时未出现大幅目标跳变。
该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。
研究提出 OCBench,一个采用可控脚本策略的机器人操作基准,通过模拟人类演示的关键特性,在受控环境中复现了行为克隆(BC)的诸多反直觉现象,如模型对数据集过拟合时性能反而持续提升、完全闭环策略在没有 action chunking 时彻底失效。借助 GPU 加速环境与脚本策略,OCBench 支持对已报道的 BC 相关现象进行科学研究,分析并驳斥了多种假设。
BRACE 是一个全身运动跟踪方法,能在斜坡地形上跟随平地参考轨迹的同时施加并补偿手部指令力。它通过地形贴合将落足点与根节点抬升至局部表面,并用 wrench 变换解算产生力的手部位移及其引发的质心与压力中心偏移。
LEAP 通过辅助解码器从视觉特征重建操作工作空间内的点云,并引入腕部视角 dropout 与部分重建目标,缓解本体感知捷径、主导视角依赖和任务无关几何主导重建这三类问题。
ProactiveVLA 在完成初始任务后,将剩余交互预算分配给智能体自提的目标,覆盖物体可供性、状态改变交互及其组合,并把任务导向与探索性经验统一整合进记忆以指导后续规划与控制。
ACG-WAM 提出 ACG-JEPA 辅助目标,从当前观测与中间动作预测多个时间跨度的几何特征,以冻结 VGGT 编码的未来槽位为监督目标。在 RoboTwin 2.0 的 50 项任务上,ACG-WAM 干净场景成功率 93.46%,随机化场景 92.68%,两场景均值 93.07%,均为对比方法中最高。
一项针对多楼层物体导航(ObjectNav)的诊断研究提出模块化分解框架,将全局策略拆分为楼层内探索策略与楼层间切换策略,其中楼层内策略通过蒸馏 Visual Language Models(VLMs)的探索逻辑学习。理论证明在理想假设下分解策略与单一全局策略在策略表示层面等价。实验表明感知性能与上下楼梯稳定性是多楼层导航的主要瓶颈。
ROMA 提出一个基于 LLM 的真实世界物体中心多感官主动感知系统,将视觉、音频、触觉与力觉整合进"推理-交互-反馈"闭环,主动识别缺失证据并选择目标物体、交互方式与传感模态。
研究者提出改进的幻影装置 Physical Twins,可在真实世界中对物理交互算法进行 RL 类测试,无需 IRB 审批与真人受试者。该装置除复现肩部球窝运动外,还渲染肩胛与前伸/后缩运动,并演示 Franka Panda 机械臂感知关节极限、完成 ADLs 与 pHRI 任务。
SWAP 框架在机器人执行过程中动态组合多个 VLA 策略,将策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,而非整个回合固定使用单一策略。
研究在冻结的 π0.5 策略上对 RoboTwin 四项任务进行 3,888 组配对回合评测,学习式纠错仅在 hammer 任务上将成功率提升 +13.5pp(95% 区间 [+9.4,+17.7]),其余三项无显著增益。
一项针对 3D 异构多智能体追逃博弈(reach-avoid games)的研究提出基数优先的加权序贯匹配方法,以 Hamilton–Jacobi–Isaacs 拦截值 $z_I(s,j)$ 作为次级分配权重,缓解仅基数匹配在几何结构场景中出现的 "Geometric Sprawl" 失败模式。
论文提出 RMRRT(Riemannian Barrier Metric RRT),在单一几何框架内统一等式与不等式约束,先由不等式敏感的势垒项构建环境势垒度量,再经与等式约束关联的 (G)-正交投影诱导切空间度量,并一致用于转向与最近邻选择。
一种可解释性引导的多目标进化方法将 DNN 控制的 LeoRover 鲁棒性测试中位成功率从无引导搜索的 53.85% 提升至 70.0%,中位超体积从 0.65 提高到 0.73。