跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学55

    开放世界全景分割:Con2MAV 方法与 PANIC 自动驾驶基准

    提出开放世界全景分割方法 Con2MAV,可在测试时发现新语义类别与新物体实例,并保持增量发现类别间的一致性,在道路到水下多类数据集上展现开放世界分割能力与已知类别竞争力。同时发布自动驾驶异常分割基准 PANIC,含 800 张图像、50 多个未知类别、4,000 多个物体实例及像素级语义与实例标注,并提供隐藏测试集竞赛。实现将在录用后开源,论文已被 IJRR 接收。

  2. arXiv cs.RO 机器人学57

    InterEvolve 提出奖励程序测试时进化方法用于人形机器人 loco-manipulation

    Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。

  3. arXiv cs.RO 机器人学55

    UniWAM:融合物理推理、世界生成与动作预测的统一世界-动作模型

    UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。

  4. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  5. arXiv cs.RO 机器人学53

    Token-World:在视觉-语言模型 Token 空间进行世界建模以实现机器人操作

    Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。

  6. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  7. arXiv cs.RO 机器人学55

    DODGER:面向动态障碍物机器人导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。

  8. arXiv cs.RO 机器人学55

    RoboActualizer 论文提出在冻结世界模型上以 60M 参数生成机器人动作

    论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。

  9. arXiv cs.RO 机器人学41

    LQR-ArUco 融合:面向两轮机器人导航与非对称操作的鲁棒分层控制

    提出 LQR-ArUco 融合的分层控制框架,解决两轮倒立摆(TWIP)机器人在非对称物体操作中的动态失稳与导航漂移。机外视觉系统跟踪 ArUco 标记提供高时延全局航点导航以绕开里程计漂移,机载低时延控制环用惯性与编码器数据抑制扰动。实测中该双环方案让自制机器人准确导航、抵御减速带冲击、适应动态跷跷板坡道并稳定搬运负载。

  10. arXiv cs.RO 机器人学44

    CoBrush:面向人机协同绘画的分层规划框架

    CoBrush 提出一种分层规划框架,把多轮人机协同绘画拆解为语义、空间与执行三层协调过程,将高层意图推断与空间定位、笔触级控制分离,支持在真实丙烯画布上渐进式构建复杂场景。真实人机绘画会话、压力测试与用户研究表明,相比单轮基线,CoBrush 在语义对齐、空间推进稳定性与机器人动作合理性上更优。该工作已被 IROS 2026 接收。

  11. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。

  12. arXiv cs.RO 机器人学54

    面向基于模型机器人设计的大语言模型

    研究提出用大语言模型构建显式工程模型的机器人设计框架,将物理关系、兼容性约束与目标显式化后再做多目标优化,以获得可行性与 Pareto 最优保证。在四旋翼与循迹小车选型问题上,30 次直接由 LLM 生成的设计试验无一能通过最终模型的可行性验证。与独立专家模型及多轮模型细化的对比显示,建模假设变化会显著改变预测的可行与 Pareto 最优设计集合。

  13. arXiv cs.RO 机器人学55

    Rolling-WAM:用滚动想象实现世界动作模型

    Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。

  14. arXiv cs.RO 机器人学55

    NavProbe:基于主动记忆检索的证据支撑推理零样本导航智能体

    NavProbe 提出一种分层零样本导航智能体,用动态子目标议程配合主动证据检索,在上下文不足时按需调取视觉与几何记录以生成、修订或解决子目标。在 R2R-CE 上取得 71.7% SR 与 55.8% SPL,RxR-CE 上 55.3% SR 与 38.6% SPL,超过强零样本基线;HM3D-v2 ObjectNav 上 SR 达 79.3%。代码已开源,并有真实机器人定性演示。

  15. arXiv cs.RO 机器人学55

    基于学习的工业机械臂操作后门攻击:一项实证安全研究

    研究在 FANUC 与 xArm 两台真实商用工业机械臂上实证评估了基于学习的机械臂操作后门攻击与防御,验证后门可在常规任务执行中保持隐蔽、仅在特定触发器出现时诱导语义错误的抓取行为。作者提出一种在线防御流程,在运行时检测并中和触发器,并与离线微调防御对比效果。评估还测量了防御流程引入的计算时延与执行开销,以判断其是否适用于高吞吐工业场景。

  16. arXiv cs.RO 机器人学55

    NavSafe-∞:在照片级真实环境中评测闭环驾驶安全的基准

    NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。

  17. arXiv cs.RO 机器人学53

    Dr-LiSA:面向 SE(3) 定位的雷达-激光雷达直接扫描配准方法

    Dr-LiSA 提出首个将 2D 旋转雷达强度测量在 SE(3) 中与 3D 激光雷达地图配准的直接方法,通过学习式前向模型从候选位姿的激光雷达子图预测雷达测量,实现预测与观测雷达扫描的直接光度对齐。在超过 90 km 道路数据上,其 SE(2) 精度超越既有雷达-激光雷达方法,并与最先进雷达-雷达定位的平面精度相当。

  18. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。

  19. arXiv cs.RO 机器人学52

    运行时用时序逻辑组合学习型机器人行为

    研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。

  20. arXiv cs.RO 机器人学54

    GraRe:面向冻结 6-DoF 抓取检测器的抓取候选重排序方法

    GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。

  21. arXiv cs.RO 机器人学47

    BC-NMPC:面向高速飞行的电池约束 NMPC,集成推进预测与轨迹重规划

    BC-NMPC 将电池与推进系统模型集成进 NMPC 框架,实时预测 UAV 的电压、电流、功率与最大可用推力,以应对高速敏捷飞行中电池耗尽导致的推力损失。实飞验证了模型精度,仿真评估了重规划算法;电池容量耗尽时,相比无感知控制器,不重规划平均位置误差降低 25%,重规划降低 88%。该方法使 UAV 在任务全程保持时间最优飞行。

  22. arXiv cs.RO 机器人学38

    PACE:通过对话式引导在人机交互中实现人格自适应

    PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。

  23. arXiv cs.RO 机器人学47

    CERPE:面向短暂协作感知的通信高效相对位姿估计框架

    CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。