跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学55

    EigenDEXplore:用人体先验结构化灵巧操作探索

    EigenDEXplore 在独立关节空间噪声上叠加沿人体数据特征向量方向的扰动,以结构化探索而非改变动作表示的方式引入相关性,在多种灵巧手上于抓取、手内重定向和接触密集操作任务中持续优于关节空间与学习动作空间基线。实验表明人体运动先验用于结构化探索时最有效,收益覆盖无结构与参考引导 RL、轨迹优化及 sim-to-real 部署,在奖励整形与课程设计较少的设置中提升最大。

  2. arXiv cs.RO 机器人学58

    SMART:大规模合成预训练实现关节物体操作的零样本 sim-to-real 迁移

    SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。

    推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。

  3. arXiv cs.RO 机器人学55

    OntoPlan:基于本体的场景表示与智能体框架,实现可扩展的机器人任务规划

    NeurIPS 2026 接收的论文提出 OntoPlan,一个基于本体场景表示的智能体框架,用于机器人任务规划。在覆盖 5 个室内环境、3 种场景规模的 150 项通用任务上,OntoPlan 平均任务成功率达 0.89,最强基线仅 0.27;平均每任务消耗 18.1k tokens,约为最高效基线的 1/5.6。场景规模增大时优势保持,且能对模糊或不可行指令追问或报告信息不足。

  4. arXiv cs.RO 机器人学55

    TacZero:用通用视觉-语言模型与触觉反馈实现免训练的插孔操作

    TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。

  5. arXiv cs.RO 机器人学58

    GaugeBench 揭示形态感知策略对机器人描述的表示脆弱性

    论文提出 GaugeBench,把固定机器人改写为物理等价的描述并评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅 51.6,而 98 个真正未见机器人仍有 1489.6。

    推荐理由:论文用等价改写描述的对照实验,量化了跨本体评测中被忽略的表示脆弱性,可迁移方法在于其隔离思路。

  6. arXiv cs.RO 机器人学52

    OpenSplatGraph:从稠密语义地图构建结构化场景图,实现开放词汇机器人感知

    OpenSplatGraph 提出一个统一框架,直接从在线 Gaussian 开放词汇语义地图构建持久化 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件化的对象提取,并将对象实例关联到持久图节点以增量更新属性与关系。该框架在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的在线开放词汇感知与下游任务性能,已被 ACCV 2026 接收。

  7. arXiv cs.RO 机器人学56

    ReDex:通过手指级柔顺交互修复仿真到真实的灵巧操作策略

    ReDex 提出一个框架,将仿真训练的基座策略适配到真实世界,通过纠正局部接触失败并引入触觉反馈来提升灵巧操作表现。在真实硬件上的两项接触密集任务中,相比仿真到真实迁移的基座策略,Object Flipping 成功率从 14% 提升到 86%(两个物体),Screwdriver Rotation 平均进度从 26.0% 提升到 95.3%(三个物体)。

  8. arXiv cs.RO 机器人学45

    SURGE:基于图像门控因子图的声呐融合水下重建与定位方法

    SURGE 提出一种相机-声呐融合框架,在因子图中联合估计 ROV 轨迹与目标位置,再用恢复的度量位姿进行声呐 Gaussian splatting 重建。在真实水下 RGB-声呐观测上的实验显示,SURGE 相比基于视觉的位姿估计方法显著提升定位一致性,并生成比 RGB Gaussian splatting 基线更紧凑、原生带度量尺度的重建结果。

  9. arXiv cs.RO 机器人学54

    高程图看不见什么:人形机器人的语义感知运动与执行感知导航

    一项面向人形机器人的基准与闭环框架提出语义感知运动与执行感知导航,建模高程图中不明显的危险物与指令执行偏差,并在仿真中评估导航、在 Unitree G1 实体机器人上验证运动策略。结果显示语义输入减少了机器人与高程图难以表征的危险物的接触,抗偏差机制提升了导航成功率。研究指出人形机器人导航需同时评估路线完成度与危险规避。

  10. arXiv cs.RO 机器人学32

    面向人机交互的可信物理 AI 框架

    arXiv 论文提出一个可信物理 AI 框架,将安全性(Safety)、行为可理解性(Behavioral Intelligibility)与感知对齐(Perceptual Alignment)整合到具身、控制、认知与设计四个层面。论文指出,机器人进入人类空间的速度快于我们建立其可信度标准的速度,可信度来自物理能力、可观察行为与用户交互预期的对齐。

  11. arXiv cs.RO 机器人学47

    机器人集群去中心化构建最短长度通信网络

    一项研究提出完全去中心化的框架,让机器人集群仅凭局部交互构建并动态维护通信网络,无需集中式拓扑规划或全局定位基础设施。形式化分析表明,局部重连操作可保证网络持续连通、每次分支转移严格缩短网络长度,最坏性能被限定在最短星形树之内。仿真与物理多机器人实验显示,该方法形成的网络长度接近集中计算的 Euclidean Steiner 树,并能动态适应移动目标、仅部署必要的连接节点。

  12. arXiv cs.RO 机器人学41

    模式不确定性下的分布迁移 Safe-Horizon MPC

    arXiv 论文提出面向障碍物切换动态模式的 Safe-Horizon Model Predictive Control(SH-MPC)分布迁移方法,从有限模式观测构建未知类别模式律的置信集,并推导乘性支配界,将碰撞风险证书从选定的场景采样分布迁移到置信集内所有模式律。

  13. arXiv cs.RO 机器人学51

    四足机器人非抓取物体搬运的鲁棒框架

    四足机器人非抓取物体搬运框架通过不确定性感知轨迹优化与耦合凸模型预测控制器,将物体滑动相比固定朝向基线减少约50%、相比直线基线减少30%,并取得更低的机器人质心跟踪误差。该方法联合预测四足机器人与负载的质心动力学,再由全身QP施加地面反力约束,在物体惯性参数变化下经仿真与真实实验验证。

  14. arXiv cs.RO 机器人学47

    AIM:面向 Real-to-Sim 软体仿真的自适应交互建模网络

    AIM 框架将 real-to-sim 软体仿真建模为局部-全局交互问题,用运动历史与几何自适应调整粒子关系,并通过几何条件化的全局通信协调整体响应。在 PhysTwin 和 PGND 上的实验显示,其未来预测跟踪误差相对 PhysTwin 降低 20.0%,六类物体的长时程粒子平均误差相对 PGND 降低 22.8%。

  15. arXiv cs.RO 机器人学41

    TeleHairing:面向机器人理发评估的遥操作基线

    TeleHairing 提出一套用于假人头机器人理发评估的闭环遥操作架构,支持本地、中继与远程三种部署条件。日志显示远程模式总时延达 190.5 ms,且时延增量主要出现在机器人侧控制端点之前;轨迹分析表明远程指令跟随误差主要来自末端回撤段,剔除该段后 RMSE 从 45.1 mm 降至 9.6 mm。检测丢失试验中 rebase 事件恢复运动时未出现大幅目标跳变。

  16. arXiv cs.RO 机器人学51

    VLM 引导的电磁数字孪生在线标定 Demo:Unitree G1 实测 20 m 内电导率误差 1.74×10⁻⁴

    该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。

  17. arXiv cs.RO 机器人学55

    OCBench:可复现行为克隆反直觉现象的机器人操作基准

    研究提出 OCBench,一个采用可控脚本策略的机器人操作基准,通过模拟人类演示的关键特性,在受控环境中复现了行为克隆(BC)的诸多反直觉现象,如模型对数据集过拟合时性能反而持续提升、完全闭环策略在没有 action chunking 时彻底失效。借助 GPU 加速环境与脚本策略,OCBench 支持对已报道的 BC 相关现象进行科学研究,分析并驳斥了多种假设。

  18. arXiv cs.RO 机器人学44

    多楼层物体导航的模块化策略学习:一个用于诊断分析的分解框架

    一项针对多楼层物体导航(ObjectNav)的诊断研究提出模块化分解框架,将全局策略拆分为楼层内探索策略与楼层间切换策略,其中楼层内策略通过蒸馏 Visual Language Models(VLMs)的探索逻辑学习。理论证明在理想假设下分解策略与单一全局策略在策略表示层面等价。实验表明感知性能与上下楼梯稳定性是多楼层导航的主要瓶颈。