CUSP:越野导航感知起点上的 CUSUM 生存风险告警
CUSP 提出一种模型无关的运行时危险告警方法,从人工干预终止的日志中学习"感知起点"——即人类判断安全驾驶开始转为危险的时刻,用离散时间生存目标训练视觉危险头,再由 CUSUM 累积风险触发告警。
CUSP 提出一种模型无关的运行时危险告警方法,从人工干预终止的日志中学习"感知起点"——即人类判断安全驾驶开始转为危险的时刻,用离散时间生存目标训练视觉危险头,再由 CUSUM 累积风险触发告警。
一篇 arXiv 机器人学论文提出将随机技能纳入基于采样的多机器人规划,把问题建模为多模态复合路网上的马尔可夫决策过程(MDP),求解得到反应式策略,使可控机器人能根据其他机器人执行操作技能的情况动态调整自身运动。该方法在规划阶段直接化解技能不确定性,避免保守基线的悲观性,实现稳健的动态多机器人协调,规划器代码已公开。
arXiv 论文提出 Model-Based Geometry-Aware Generative Optimization(2GO),面向四足与人形机器人的 Constrained Locomotion Planning,通过法向诱导度量塑形、切空间随机滤波与 CFS 回缩把主动约束几何转为可执行去噪算子,并以自适应扩散与流式调度解耦生成传输与反向随机性。
StairVLA 提出阶段感知分层动作生成框架,用部分去噪动作作为粗粒度长时程生成与局部精修的接口,高层 VLA 负责早期去噪,轻量 refiner 以更高频率用最新观测精修局部动作块。
CoRE 从多任务、多机器人演示中学习协作-角色专家,让每台机器人仅凭自身视觉观测与本体感觉运行同一策略,无需任务提示、身份标签或机器人间消息,即可在去中心化协作操作中产生互补行为。在仿真基准上,CoRE 取得所评测去中心化方法中的最高平均性能;物理实验验证了其在多种操作任务上的有效协作,以及对协作方延迟与减速的鲁棒性。
一项面向精密装配的研究提出特权噪声蒸馏方法,在 FORGE benchmark 上将 σ=5 mm 位姿噪声下的成功率从基准策略的 32%–60% 提升至 92%–99%,六个非特权基线仅 2%–80%。
ESP(Energy-Score Policy)提出一种免蒸馏方法,用单次网络评估将策略上下文与噪声直接映射为动作块,动作头以 energy score 而非均方误差训练,实现对多模态动作分布的直接学习。仿真与真实操作任务实验显示,其任务成功率与 flow matching 基线相当,而动作生成时延大幅降低。
ExoBridge 框架通过人体肢体耦合,从裸手视频学习映射到穿戴式外骨骼的运动与触觉状态:采集时一只手保持裸露提供视觉观测,另一只手穿戴外骨骼提供同步的运动与触觉测量。
EigenDEXplore 在独立关节空间噪声上叠加沿人体数据特征向量方向的扰动,以结构化探索而非改变动作表示的方式引入相关性,在多种灵巧手上于抓取、手内重定向和接触密集操作任务中持续优于关节空间与学习动作空间基线。实验表明人体运动先验用于结构化探索时最有效,收益覆盖无结构与参考引导 RL、轨迹优化及 sim-to-real 部署,在奖励整形与课程设计较少的设置中提升最大。
SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。
推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。
Silicon Language 提出机器人原生知识交换框架,让机器人把自己的经验编码为知识包发布,经接收端可用性评估、渐进融合与自动回滚后移植到自身传感器与执行器。
NeurIPS 2026 接收的论文提出 OntoPlan,一个基于本体场景表示的智能体框架,用于机器人任务规划。在覆盖 5 个室内环境、3 种场景规模的 150 项通用任务上,OntoPlan 平均任务成功率达 0.89,最强基线仅 0.27;平均每任务消耗 18.1k tokens,约为最高效基线的 1/5.6。场景规模增大时优势保持,且能对模糊或不可行指令追问或报告信息不足。
一项研究提出用受限控制器下的任务能力评估机器人形态,在 EvoGym 三项运动任务中,任务奖励仅能解释该指标 39%、33% 和 10% 的方差,几何描述符也无法预测它。
TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。
一项面向软体机器人损伤恢复的无先验可复现基准发布,在九次在线试验协议下,GP-EI 参考控制器在两个各含 75 个本体的队列上以 0.235-0.310 的平均最差掩码奖励超越 random search、Sobol、CEM 和 CMA-ES,并在 69/75 个确认本体上取得增益。
论文提出一种从未分割点云中学习抓取目标的策略,用于液压林业起重机的原木清堆作业,策略在观测点上分类抓取位置并预测深度与抓斗姿态,同一网络支持行为克隆、强化学习和部署。
一篇 arXiv 论文提出在世界模型(WM)隐空间中建模隐空间扰动,通过动力学感知相似度度量与分布外检测构建合理隐动力学集合,并用 conformal prediction 校准不确定性集合,再以博弈论优化联合求解鲁棒机器人动作与最坏情况扰动。
论文提出 GaugeBench,把固定机器人改写为物理等价的描述并评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅 51.6,而 98 个真正未见机器人仍有 1489.6。
推荐理由:论文用等价改写描述的对照实验,量化了跨本体评测中被忽略的表示脆弱性,可迁移方法在于其隔离思路。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
OpenSplatGraph 提出一个统一框架,直接从在线 Gaussian 开放词汇语义地图构建持久化 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件化的对象提取,并将对象实例关联到持久图节点以增量更新属性与关系。该框架在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的在线开放词汇感知与下游任务性能,已被 ACCV 2026 接收。
论文提出即插即用的物理引导视觉提示(PG-VP)模块,通过在冻结的 VLA 模型输入上叠加随帧移动的虚拟障碍物,使导航策略绕开辐射与温度等不可见危险,无需重新训练。
CoRL 2026 收录的 TIGER 框架将动作分块模仿策略作为任务空间进度估计器,把预测动作块经控制器感知的动作-运动映射转为末端执行器参考,为 RL 智能体提供稠密进度奖励,同时保留稀疏环境奖励为主目标。
ReDex 提出一个框架,将仿真训练的基座策略适配到真实世界,通过纠正局部接触失败并引入触觉反馈来提升灵巧操作表现。在真实硬件上的两项接触密集任务中,相比仿真到真实迁移的基座策略,Object Flipping 成功率从 14% 提升到 86%(两个物体),Screwdriver Rotation 平均进度从 26.0% 提升到 95.3%(三个物体)。
ProCut 提出一个全可微框架,用基于 sigmoid 的连续化方法平滑组织切割的离散事件,并在可微 Position-Based Dynamics(PBD)仿真中结合 Stein Variational Gradient Descent(SVGD)做粒子概率推断,生成多个拓扑状态假设。
MobileVISTA 是一个数据生成框架,把在标准位姿下采集的演示转化为带位姿扰动的训练数据,同时增强自我中心视觉观测并重定向动作以补偿基座位姿变化。
一种风险敏感人群导航框架采用自适应椭球共形预测(AECP)捕捉方向性预测误差,并将结构化不确定性转化为 CVaR 信号调节 Lagrangian 安全惩罚,策略用 Lagrangian proximal policy optimization 优化。
SURGE 提出一种相机-声呐融合框架,在因子图中联合估计 ROV 轨迹与目标位置,再用恢复的度量位姿进行声呐 Gaussian splatting 重建。在真实水下 RGB-声呐观测上的实验显示,SURGE 相比基于视觉的位姿估计方法显著提升定位一致性,并生成比 RGB Gaussian splatting 基线更紧凑、原生带度量尺度的重建结果。
一篇 ICRA 2026 论文提出用一系列刚性连杆替代无质量刚性杆假设,通过 Euler-Newton 推导多无人机吊挂负载系统(MUSLS)的动力学模型,并适配 Featherstone's articulated body algorithm 高效仿真。实机验证显示负载平移平均误差低于 132 mm(绳长的 5.5%),姿态误差低于 11.4 度,作者同时公开了真实飞行数据。
arXiv 论文提出熵门控信念协调(Entropy-Gated Belief Coordination),在多智能体集体熵比超过阈值 θ 时跳过信念融合、仅在开发阶段合并。
RACER 提出面向轮式四足竞速的分层控制框架,将 MPPI 规划器、学习式残差动力学模型与底层 RL 速度跟踪器结合,用神经残差项刻画 RL 策略的闭环跟踪行为。
一款自主、低成本、水射流动力的开源三体机器人船平台发布,开发成本为 $600-1,500 USD(取决于传感系统配置),重量低于 5 kg,最高航速达 2 m/s 并可对岩石等自然障碍物进行避障。
一项面向人形机器人的基准与闭环框架提出语义感知运动与执行感知导航,建模高程图中不明显的危险物与指令执行偏差,并在仿真中评估导航、在 Unitree G1 实体机器人上验证运动策略。结果显示语义输入减少了机器人与高程图难以表征的危险物的接触,抗偏差机制提升了导航成功率。研究指出人形机器人导航需同时评估路线完成度与危险规避。
AeroBuoy 获得 IROS 2025 安全、安保与救援机器人最佳论文奖,该系统由可无人机投放的3D打印自主浮标组成,借助 GPS 与磁力计沿河道自主航行,可测量水温并按需加装溶氧仪、声纳或浊度传感器,已在新西兰奥克兰 Ōrewa River 完成全系统演示。
arXiv 论文提出一个可信物理 AI 框架,将安全性(Safety)、行为可理解性(Behavioral Intelligibility)与感知对齐(Perceptual Alignment)整合到具身、控制、认知与设计四个层面。论文指出,机器人进入人类空间的速度快于我们建立其可信度标准的速度,可信度来自物理能力、可观察行为与用户交互预期的对齐。
arXiv 论文 arXiv:2610.07371 分析了 TCPA、DCPA 与 Velocity Obstacles(VO)在碰撞风险评估中的关系与不确定性行为。
ScanSTL 将关联时间聚合与并行扫描、有序块归约结合,用线性工作量与存储、对数并行深度计算精确时序算子的完整鲁棒性轨迹,并提供支持自动微分、批处理与编译的开源 JAX 实现。
SharedKV-BT 让行为树(BT)的每个活跃节点暴露阶段本地字段与候选,由 Shared-KV 并行打分并把选中决策交给独立执行系统,在机器人操作、移动导航和 computer-use 三类任务上,类型化决策速度比 prompt 匹配的自回归解码快 2.36-4.15 倍。
一项研究提出完全去中心化的框架,让机器人集群仅凭局部交互构建并动态维护通信网络,无需集中式拓扑规划或全局定位基础设施。形式化分析表明,局部重连操作可保证网络持续连通、每次分支转移严格缩短网络长度,最坏性能被限定在最短星形树之内。仿真与物理多机器人实验显示,该方法形成的网络长度接近集中计算的 Euclidean Steiner 树,并能动态适应移动目标、仅部署必要的连接节点。
论文提出一种乐高式刚度配置方法,通过可堆叠的平面柔顺模块实现面向任务的柔性接口刚度设计,实验验证仿真刚度偏差低于 6.5%。该方法结合遗传算法与序列二次规划两阶段优化,通过梁宽、板厚和模块朝向调节刚度特性。基于该框架开发的柔性腕在 1 m/s 高速运动下保持柔顺避障,最大测试角度柔顺性约 $15^\circ$。
NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。
推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。