跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学55

    NavSafe-∞:在照片级真实环境中评测闭环驾驶安全的基准

    NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。

  2. arXiv cs.RO 机器人学53

    Dr-LiSA:面向 SE(3) 定位的雷达-激光雷达直接扫描配准方法

    Dr-LiSA 提出首个将 2D 旋转雷达强度测量在 SE(3) 中与 3D 激光雷达地图配准的直接方法,通过学习式前向模型从候选位姿的激光雷达子图预测雷达测量,实现预测与观测雷达扫描的直接光度对齐。在超过 90 km 道路数据上,其 SE(2) 精度超越既有雷达-激光雷达方法,并与最先进雷达-雷达定位的平面精度相当。

  3. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。

  4. arXiv cs.RO 机器人学52

    运行时用时序逻辑组合学习型机器人行为

    研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。

  5. arXiv cs.RO 机器人学54

    GraRe:面向冻结 6-DoF 抓取检测器的抓取候选重排序方法

    GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。

  6. arXiv cs.RO 机器人学47

    BC-NMPC:面向高速飞行的电池约束 NMPC,集成推进预测与轨迹重规划

    BC-NMPC 将电池与推进系统模型集成进 NMPC 框架,实时预测 UAV 的电压、电流、功率与最大可用推力,以应对高速敏捷飞行中电池耗尽导致的推力损失。实飞验证了模型精度,仿真评估了重规划算法;电池容量耗尽时,相比无感知控制器,不重规划平均位置误差降低 25%,重规划降低 88%。该方法使 UAV 在任务全程保持时间最优飞行。

  7. arXiv cs.RO 机器人学38

    PACE:通过对话式引导在人机交互中实现人格自适应

    PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。

  8. arXiv cs.RO 机器人学47

    CERPE:面向短暂协作感知的通信高效相对位姿估计框架

    CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。

  9. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  10. arXiv cs.RO 机器人学47

    GEM-Occ:从视觉几何证据到具身语义占据记忆

    GEM-Occ 提出 Gaussian Evidence Memory 框架,将多视角累积的几何与语义证据整合为持久的语义占据记忆,支持跨房间的持续建图与高效查询。团队同时发布 HIOcc 基准,统一语义标签空间与评测框架,覆盖局部预测、房间级在线建图和建筑级建图。实验显示 GEM-Occ 在 HIOcc 上优于现有方法,兼顾内存占用与占据查询速度。

  11. arXiv cs.RO 机器人学51

    Mask2Real-WM:以分割掩码作为 Sim-to-Real 桥梁的可控灵巧世界模型

    Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。

  12. arXiv cs.RO 机器人学58

    SVA 框架将树搜索蒸馏为动作评估器,提升冻结 VLA 模型的泛化能力

    论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。

    推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。

  13. arXiv cs.RO 机器人学53

    可重构摇臂-转向架机器人实现高越障与高效转向

    该研究提出一种可重构摇臂-转向架机构,通过在转向架关节安装电机主动摆动,在四轮与六轮构型间切换,转向架末端安装全向轮实现四轮差速转向。样机实验显示,其零半径转向速度超过传统六轮摇臂-转向架机构 5 倍,平均轮端总扭矩仅约 17%。机器人成功攀爬 40 cm 台阶,平均攀爬时间 6.4 s。

  14. arXiv cs.RO 机器人学56

    面向真实机器人五球杂耍的任务误差残差学习

    通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。

  15. arXiv cs.RO 机器人学51

    CANMOT:面向自动驾驶多目标跟踪的类别感知噪声建模

    CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。

  16. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  17. arXiv cs.RO 机器人学52

    BiMoSG:面向开放集任务的双模态 3D 场景图生成方法

    BiMoSG 提出双模态 3D 场景图生成方法,面向开放集任务执行,默认以"fast"模式高效生成粗粒度场景图,遇到可能包含任务相关物体的区域时切换到"slow"模式生成细粒度开放词汇 3D 场景图。该方法生成速度显著快于开源 state-of-the-art 方案,可将场景图生成与任务执行集成,支持实时部署。

  18. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  19. arXiv cs.RO 机器人学54

    面向自主伤亡分类的机器人系统贝叶斯推理框架

    该自主机器人伤亡评估系统融合多种视觉算法输出,以专家规则构建的贝叶斯网络对伤情做概率推理,在 DARPA Triage Challenge 的 11 人与 9 人伤亡场景中,生理评估准确率从 15% 提升至 42%、19% 提升至 46%。整体分类准确率从 14% 升至 53%,诊断覆盖率从 31% 扩展到 95%。

  20. arXiv cs.RO 机器人学45

    三值逻辑编码的时序行为树及其在控制综合中的应用

    研究者将时序行为树(TBT)重构为三值信号时序逻辑(STL)形式,引入第三真值 Unknown 以刻画轨迹既未完全满足也未违反规范的情形,并为部分轨迹 STL 与 TBT 提出混合整数线性编码。该编码通过混合整数优化为线性动力系统生成构造即正确的控制策略,论文已获 IEEE CDC 2026 接收。

  21. arXiv cs.RO 机器人学43

    强化学习结合有界极值搜索提升机器人控制在分布偏移下的鲁棒性

    该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。

  22. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。

  23. arXiv cs.RO 机器人学56

    FoMo:面向 Forêt Montmorency 多季节机器人导航数据集发布

    研究团队发布 FoMo 多季节数据集,在北方森林中历时一年、12 次部署采集超过 64 km 的六条多样化轨迹,用于挑战现有里程计与 SLAM 流程。数据涵盖旋转与混合固态激光雷达、FMCW 雷达、立体与单目相机及两个 IMU,真值由三台 GNSS 接收机与静态基站后处理得到,并附气象站、相机标定和车辆功耗等元数据。

  24. arXiv cs.RO 机器人学56

    TDC:面向接触密集操作的仿真到现实可迁移方向柔顺控制

    浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。

  25. arXiv cs.RO 机器人学47

    TRACER:面向可变形物体区域定位的纹理鲁棒可供性思维链框架

    TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。