跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学38

    PACE:通过对话式引导在人机交互中实现人格自适应

    PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。

  2. arXiv cs.RO 机器人学47

    CERPE:面向短暂协作感知的通信高效相对位姿估计框架

    CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。

  3. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  4. arXiv cs.RO 机器人学47

    GEM-Occ:从视觉几何证据到具身语义占据记忆

    GEM-Occ 提出 Gaussian Evidence Memory 框架,将多视角累积的几何与语义证据整合为持久的语义占据记忆,支持跨房间的持续建图与高效查询。团队同时发布 HIOcc 基准,统一语义标签空间与评测框架,覆盖局部预测、房间级在线建图和建筑级建图。实验显示 GEM-Occ 在 HIOcc 上优于现有方法,兼顾内存占用与占据查询速度。

  5. arXiv cs.RO 机器人学51

    Mask2Real-WM:以分割掩码作为 Sim-to-Real 桥梁的可控灵巧世界模型

    Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。

  6. arXiv cs.RO 机器人学58

    SVA 框架将树搜索蒸馏为动作评估器,提升冻结 VLA 模型的泛化能力

    论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。

    推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。

  7. arXiv cs.RO 机器人学53

    可重构摇臂-转向架机器人实现高越障与高效转向

    该研究提出一种可重构摇臂-转向架机构,通过在转向架关节安装电机主动摆动,在四轮与六轮构型间切换,转向架末端安装全向轮实现四轮差速转向。样机实验显示,其零半径转向速度超过传统六轮摇臂-转向架机构 5 倍,平均轮端总扭矩仅约 17%。机器人成功攀爬 40 cm 台阶,平均攀爬时间 6.4 s。

  8. arXiv cs.RO 机器人学56

    面向真实机器人五球杂耍的任务误差残差学习

    通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。

  9. arXiv cs.RO 机器人学51

    CANMOT:面向自动驾驶多目标跟踪的类别感知噪声建模

    CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。

  10. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  11. arXiv cs.RO 机器人学52

    BiMoSG:面向开放集任务的双模态 3D 场景图生成方法

    BiMoSG 提出双模态 3D 场景图生成方法,面向开放集任务执行,默认以"fast"模式高效生成粗粒度场景图,遇到可能包含任务相关物体的区域时切换到"slow"模式生成细粒度开放词汇 3D 场景图。该方法生成速度显著快于开源 state-of-the-art 方案,可将场景图生成与任务执行集成,支持实时部署。

  12. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  13. arXiv cs.RO 机器人学54

    面向自主伤亡分类的机器人系统贝叶斯推理框架

    该自主机器人伤亡评估系统融合多种视觉算法输出,以专家规则构建的贝叶斯网络对伤情做概率推理,在 DARPA Triage Challenge 的 11 人与 9 人伤亡场景中,生理评估准确率从 15% 提升至 42%、19% 提升至 46%。整体分类准确率从 14% 升至 53%,诊断覆盖率从 31% 扩展到 95%。

  14. arXiv cs.RO 机器人学45

    三值逻辑编码的时序行为树及其在控制综合中的应用

    研究者将时序行为树(TBT)重构为三值信号时序逻辑(STL)形式,引入第三真值 Unknown 以刻画轨迹既未完全满足也未违反规范的情形,并为部分轨迹 STL 与 TBT 提出混合整数线性编码。该编码通过混合整数优化为线性动力系统生成构造即正确的控制策略,论文已获 IEEE CDC 2026 接收。

  15. arXiv cs.RO 机器人学43

    强化学习结合有界极值搜索提升机器人控制在分布偏移下的鲁棒性

    该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。

  16. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。

  17. arXiv cs.RO 机器人学56

    FoMo:面向 Forêt Montmorency 多季节机器人导航数据集发布

    研究团队发布 FoMo 多季节数据集,在北方森林中历时一年、12 次部署采集超过 64 km 的六条多样化轨迹,用于挑战现有里程计与 SLAM 流程。数据涵盖旋转与混合固态激光雷达、FMCW 雷达、立体与单目相机及两个 IMU,真值由三台 GNSS 接收机与静态基站后处理得到,并附气象站、相机标定和车辆功耗等元数据。

  18. arXiv cs.RO 机器人学56

    TDC:面向接触密集操作的仿真到现实可迁移方向柔顺控制

    浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。

  19. arXiv cs.RO 机器人学47

    TRACER:面向可变形物体区域定位的纹理鲁棒可供性思维链框架

    TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。

  20. arXiv cs.RO 机器人学53

    RVC-NMPC:基于互易速度约束的非线性模型预测控制实现敏捷 UAV 飞行中的互碰撞规避

    RVC-NMPC 将时变互易速度约束(RVC)直接集成进非线性模型预测控制(NMPC)问题,仅依赖对其他机器人的可观测信息即可实现 UAV 互碰撞规避,整条流水线运行在 100 Hz。仿真覆盖最多 10 架 UAV、速度达 25 m/s,实飞实验加速度达 30 m/s²。与现有方法相比,该方法在挑战性场景中飞行时间缩短 31%,所有试验均保持无碰撞导航。

  21. arXiv cs.RO 机器人学45

    最小限制超平面控制障碍函数(Least Restrictive Hyperplane CBFs)

    提出最小限制超平面控制障碍函数(Least Restrictive Hyperplane CBFs),通过优化支撑超平面朝向降低保守性,使安全控制更接近期望控制。该方法将常见基于距离的 CBF 视为 H-CBF 的特例,在带加速度约束的双积分器系统上穿越任意形状的静态与动态障碍群进行验证。结果显示,期望控制与安全控制之间的平均差距缩小一个数量级。

  22. arXiv cs.RO 机器人学47

    具身智能时代基于物理仿真器的机器人导航与操作综述

    一篇综述分析物理仿真器如何缩小机器人导航与操作任务的 sim-to-real 差距,考察以往综述较少关注的仿真器属性、任务特性与硬件需求。文章还整理了基准数据集、评测指标、仿真平台与方法资源,帮助研究者在硬件约束下选择合适工具。该综述共 35 页、9 幅图,已被 ACM Computing Surveys (CSUR) 接收。

  23. arXiv cs.RO 机器人学52

    消除抓取任务中的夹爪状态歧义:伪触觉反馈实现纯仿真学习

    研究提出用伪触觉作为反馈消除抓取操作任务中的夹爪状态歧义,使模仿学习策略可完全在仿真中训练。该方法受力控夹爪充当触觉传感器的思路启发,为策略提供无噪声的二值夹爪状态观测,无需额外数据采集或硬件改动。三项真实抓取任务实验验证了其必要性、有效性与高效性,成果已被 IROS 2025 接收。

  24. arXiv cs.RO 机器人学41

    从运动学运动规划器到具备避障能力的动态自主导航(扩展版)

    研究提出一种将现有基于反馈的运动学运动规划器适配到二阶自主系统的方法,同时保留其安全性与几乎全局渐近稳定性保证。方法覆盖两类运动学运动规划器:基于导航函数推导的规划器,以及直接通过期望速度场定义、不依赖底层导航函数的规划器。两个基于反馈的运动学运动规划器被适配到二阶系统,并在仿真与实验中得到验证。

  25. arXiv cs.RO 机器人学45

    面向自动驾驶的遮挡感知应急安全关键规划

    该研究提出一种面向实时自动驾驶的遮挡感知应急安全关键规划方法,用幻影车辆的前向可达集推导风险感知动态速度边界,并以时空屏障约束写入双凸非线性规划,同时优化探索与回退轨迹。基于共识 ADMM 将问题分解为低维凸子问题以实现实时求解。仿真与遮挡路口实车实验验证了安全性与通行效率提升。

  26. arXiv cs.RO 机器人学47

    螺旋几何结合多臂老虎机:增量获取示教以生成机器人操作规划

    研究提出让机器人逐条主动索取运动学示教的方法,用螺旋几何表示从示教生成操作规划并使示教充分性可度量,结合基于 PAC-learning 的多臂老虎机采样策略评估任务空间子区域的规划能力,并用启发式从薄弱区域追加示教。22 名无机器人背景参与者在倒水和舀取两项任务上的用户研究表明,少于 10 条示教即可教会机器人规划任务。成果发表于 2026 IEEE ICRA。