跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学49

    Odyssey:面向长时程真实世界驾驶的闭环基准,采用显式导航路线

    Odyssey 提出一个长时程闭环驾驶基准,包含 100 个场景,每个场景由 100 秒 nuPlan 驾驶日志重建,以保留导航操作与交通交互上下文。基准用显式标准定义(SD)地图路线替代方向指令,并引入 SD Route Compliance、Pre-Lane Change Score 与 RouteDS 指标评估规划器路线遵循与变道准备能力。基准代码与适配后的基线将公开发布。

  2. arXiv cs.RO 机器人学44

    FAVOR:面向世界动作模型的未来锚定验证与在线恢复框架

    FAVOR 是面向世界动作模型(WAM)的轻量级验证与恢复框架,将 WAM 行动前预测的未来帧保留为锚点,由 Anchor Verifier 比对观测与锚点及已执行动作以标记破坏任务的偏差,再由 Anchor-Guided Recovery 借助视觉语言模型生成简短纠正指令,让 WAM 在强化指令引导下回到预期未来并继续任务。

  3. arXiv cs.RO 机器人学53

    VLA-ZO:面向视觉-语言-动作模型的快速零阶适配框架

    VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。

  4. arXiv cs.RO 机器人学58

    研究揭示 VLA 机器人策略存在视觉接地缺口,任务成功未必遵循指令

    该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。

    推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。

  5. arXiv cs.RO 机器人学55

    Adaptive Mean Flow 实现平滑响应式闭环机器人控制

    Aksel Vaaler 等人提出 Adaptive Mean Flow(AMF),一种基于流匹配的模仿学习方法,用于实现平滑且响应迅速的全闭环机器人控制。AMF 采用 Mean Flow(Flow Matching 的加速形式)降低预测时延,并在预测新动作时引入上一步轨迹的腐蚀版本,信噪比随轨迹时间参数递增,从而抑制相邻步之间的大幅变化。

  6. arXiv cs.RO 机器人学47

    Recon2Servo:基于学习式图像到运动推断的机器人超声视觉伺服

    Recon2Servo 提出一种从 B-mode 图像直接学习图像到运动推断的视觉伺服框架,实现超声探头 6-DoF 控制。框架采用带低秩适配的 DINOv3 编码器与双向关系模块估计当前与目标图像间的探头相对位姿,结合监督相对位姿学习、重建引导闭环自适应与有界残差位姿修正。在公开数据集及 12 名健康志愿者采集的内部数据集上验证了重建体伺服效果,并在人体前臂演示目标视图对齐与动态跟踪。

  7. arXiv cs.RO 机器人学47

    P3:面向约束扩散控制的持续粒子规划

    P3 提出一种基于序列蒙特卡洛的扩散控制框架,在重规划步骤间维护加权候选轨迹群体,通过约束感知加权与重采样在不重训扩散模型的前提下满足测试时约束。理论分析表明重加噪深度控制已保留轨迹的路线稳定性,且保留稀有分离路线所需粒子数远少于从头采样。在迷宫导航任务中,P3 相比重新生成群体或约束优化修正单条采样轨迹的方法规划更快,减少路线切换并提升成功率,且每次重规划所需去噪迭代更少。

  8. arXiv cs.RO 机器人学45

    ARISE:面向 Sophia 人形机器人的社会推理与具身交互智能体框架

    ARISE 框架在 Sophia 人形机器人上打通社会推理与具身表达,整合多模态上下文理解、长期记忆及反应式与主动式交互,将社会意图转化为与语音和机械面部表情协同的机器人原生手势。流式执行在 Sophia 上的评测显示交互质量与具身行为协调性良好,并显著降低时延。

  9. arXiv cs.RO 机器人学58

    Mulligan 提出面向机器人在机学习的性能引导数据采集方法

    Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。

    推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。

  10. arXiv cs.RO 机器人学56

    VLA 指令中的隐含危害:文本守卫漏检,机器人照样执行

    研究测试 VLA 安全监视器能否识别"任务无害但动机有害"的指令,发现 π0.5 在各种意图显式程度下均照常完成任务,与无害对照组无异。文本守卫几乎能拦下直白请求,却漏掉隐含危害:最高 95% 的隐含危害运行完成任务且未触发告警,重新校准后仍达 90%。监控模型激活也未能弥合差距,线性探针在基础语言与视觉-语言模型中近乎完美区分有害指令,但经机器人训练后该分离度在两个模型族中减弱。

  11. arXiv cs.RO 机器人学56

    PHRetune:基于演示校准的端口哈密顿阻抗增益重调方法

    论文提出离线方法 PHRetune,为冻结的操作策略直接推导下游阻抗控制器的刚度与阻尼增益,无需评估回放或增益搜索。该方法从演示数据学习端口哈密顿模型,估算策略预测动作对应的 effort 与 energy 预算,并据此闭式求解单一增益缩放系数,在评估前固定增益,且不依赖机械臂模型、任务奖励、策略重训练或额外运行时计算。

  12. arXiv cs.RO 机器人学55

    The Unexpired Plan:为加速扩散策略提供免费监视器

    提出 The Unexpired Plan,用分块策略尚未过期的上一段规划作为免费统计量,为免训练加速的扩散策略提供监视器,在 114 种加速配置和四个策略族上以闭环成功率定价。相比每次拒绝后重新武装的门控,吸收式响应仅损失 1 分,将单次调用计算量削减 1.55–3.09 倍。在接触密集的第五个策略族上,无监视器方案均无法守住 ±2 分边界,带监视器方案可以。

  13. arXiv cs.RO 机器人学56

    FreeSpeed 提出免训练的生成式机器人策略执行速度控制方法

    FreeSpeed 是一种免训练模块,对预训练策略输出的动作块按请求速率重采样,并以相邻动作的方向不一致度作为信号自适应缩放步长,从而在保持任务成功率的前提下在线调节执行速度。在三个策略族、50 个仿真任务上,保持各任务成功率的设置中实际执行速率为 0.22x 到 2.53x;在四个真实操作任务上平均成功率 94.0%,与冻结策略的 93.8% 相当,实际执行速率为 0.38x 到 1.97x。

  14. arXiv cs.RO 机器人学53

    RMMBench:面向机器人移动操作的综合评测基准

    RMMBench 提出一个统一框架,将高低层级具身任务整合为"导航-操作"任务套件,覆盖 70 个典型任务场景,从局部操作延伸到长时程复合导航,用于评估 VLM 在连续空间中理解语言指令并执行长时程任务的能力。评测结果显示,领先 VLM 在移动操作任务的空间定位上仍面临重大挑战,凸显长时程交互中增强机器人空间感知能力的必要性。该基准已被 CoRL 2026 接收。

  15. arXiv cs.RO 机器人学52

    在未建模状态依赖下使用学习型 Critic 的最优控制

    该框架用残差动力学网络补全名义解析模型缺失的状态依赖效应,并以学习型动作价值 Critic 将长时域 MDP 结构注入局部 iLQR 优化。配套的 GPU 加速批量 iLQR 求解器可在最优控制回路内评估学习网络,并行求解数千条轨迹优化问题。在有偏且未完整建模的控制任务上,闭环控制性能得到提升,同时保留了约束轨迹优化所需的模型结构。

  16. arXiv cs.RO 机器人学55

    VAMPS:基于采样规划的视觉与运动策略学习框架

    VAMPS 提出用 MPPI 控制训练可复用机器人策略,无需人类示教,支持仿真迭代训练与真实机器人数据直接训练两种模式。仿真模式下策略热启动 MPPI 并用 IQL critic 更新,学到的运动策略迁移到 Unitree Go2;真实模式在 Flexiv Rizon 10S 上用 Action Chunking with Transformers 离线训练,完成抓取放置与力感知白板擦拭。

  17. arXiv cs.RO 机器人学45

    基于数字孪生的 AR 遥操作接口用于灵巧操作:Now You Feel It, Now You See Me

    提出一种基于数字孪生的 AR 遥操作接口,融合裸手追踪、双手机器手与机器人/任务物体的虚拟表示,用于灵巧操作演示采集。接口将触觉测量渲染到机器人手网格上形成视-力反馈,并提供用户可控虚拟视角面板或遮挡感知透明渲染以缓解遮挡。通过 Task 1 与 Task 2 用户研究评估力可视化与视觉辅助在精细力控和遮挡操作任务中的作用。

  18. arXiv cs.RO 机器人学45

    PreAct-Nav:面向城市导航的行动前智能体推理框架

    PreAct-Nav 提出一种智能体导航框架,为冻结策略加入预期推理以实现稳健的城市导航。框架以导航记忆模块维护中程子目标与经验,并用动作条件世界模型 AC-WM 预测候选动作后果,由视觉语言模型 VLM 推理器据此保留或修正动作。评测显示该方法通过记忆更新与视觉预测改善动作选择,在更长、转弯更多的路线上增益更明显。

  19. arXiv cs.RO 机器人学47

    流策略作为技能级世界模型的动作:面向长时程规划的学习与符号抽象

    研究者用 flow-matching 策略的输入构造技能级动作,使一次完整技能执行对应一次世界模型转移,并提出压缩种子、两种从演示学习的离散码和符号标签四种动作抽象。在需最多 14 个顺序技能的模拟积木重排任务中,符号标签在最多六个技能的任务上成功率超 90%,无标签的物体中心学习码在单技能任务上与之相当。消融显示标签优势主要来自规划器知晓动作适用性,超过六个技能后限制成功率的是搜索而非世界模型。

  20. arXiv cs.RO 机器人学47

    LLM 机器人团队中的隐蔽内部攻击:少说谎、说大谎

    研究提出针对 LLM 机器人团队的隐蔽内部攻击模型:单个被攻陷机器人在多机器人测绘任务中,受限于团队检测器而非能量预算。推导出两个界——攻击报告被验证概率的下界(取决于通信图度数与验证预算),以及线性规划给出的地图误差上界,揭示"少说谎、说大谎"的最优攻击策略。实验中诚实机器人为 LLM agent,两个界在攻击实际花费的预算处均成立,且 LLM 复查记录的选择无偏但复查量不可预测。

  21. arXiv cs.RO 机器人学55

    TTT-RM:将 Test-Time Training 作为机器人策略的残差记忆

    TTT-RM 将 Test-Time Training 重构为残差记忆,用快速权重补充有界记忆库,保留当前上下文无法恢复的任务相关历史信息。该方法学习历史解码器,以重建残差作为 TTT 慢权重优化目标,使在线快速权重更新编码互补历史。在记忆密集型仿真基准与真实任务上,TTT-RM 在多种记忆设计中一致提升,支持三分钟八阶段收纳任务的持续执行。