跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学55

    InterMimicGen 通过自进化动作模仿扩展人形机器人 loco-manipulation

    研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。

  2. arXiv cs.RO 机器人学55

    RV-ICL:面向智能体机器人的递归视频上下文学习

    RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。

  3. arXiv cs.RO 机器人学59

    AffordCraft 用单张 RGB 图像检索构建任务可用的仿真资产

    AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。

    推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。

  4. arXiv cs.RO 机器人学51

    ArtifactArena:用物理世界中的构建成果评测模型

    ArtifactArena 是一个开放式平台,让模型在物理接地的软硬件协同设计挑战中工程化构建可运行机器人并在模拟竞技场对战。平台通过文本描述、物理仿真器反馈和游戏数据三种 harness 评测前沿模型的零样本、验证器引导精修与开放式物理设计能力,并用对战 Elo 排名对模型进行基准测试。该框架与赛事基础设施将开放社区持续提交,形成不饱和的开放式智能测试床。

  5. arXiv cs.RO 机器人学49

    Odyssey:面向长时程真实世界驾驶的闭环基准,采用显式导航路线

    Odyssey 提出一个长时程闭环驾驶基准,包含 100 个场景,每个场景由 100 秒 nuPlan 驾驶日志重建,以保留导航操作与交通交互上下文。基准用显式标准定义(SD)地图路线替代方向指令,并引入 SD Route Compliance、Pre-Lane Change Score 与 RouteDS 指标评估规划器路线遵循与变道准备能力。基准代码与适配后的基线将公开发布。

  6. arXiv cs.RO 机器人学38

    集体意识分类学:Mutual Awareness、Shared Situational Awareness 与 Team Situational Awareness 的二维分类

    该研究提出二维分类学,沿"意识对象"与"意识分布"两个轴区分 Mutual Awareness、Shared Situational Awareness 与 Team Situational Awareness,指出三者构成包含层级而非同义词,分布谱系从完全个体化理解(MA)到完全统一理解(SSA),TSA 居于混合位置。

  7. arXiv cs.RO 机器人学47

    基于深度强化学习与进化混合设计的视觉群体导航

    阿利坎特大学团队提出一种结合多智能体强化学习与神经进化策略的混合方法,自动合成用于自主视觉导航的群体机器人控制器,仅依赖单目相机图像的紧凑神经网络面向低成本资源受限平台。在高保真物理仿真中,采用交叉熵方法训练的控制器探索覆盖率比协方差矩阵自适应进化策略高 36.20%。最佳视觉策略探索性能与依赖距离传感器的传统方法统计相当,平均能耗降低 31.40%。

  8. arXiv cs.RO 机器人学31

    面向开放环境中稳健抓取操作的 Quality-Diversity 方法

    研究提出用 Quality-Diversity(QD)算法解决开放环境中的机器人抓取操作任务,高效发现多种稳健抓取构型,作为在铰接物体上生成多样化操作轨迹的可靠起点。操作行为的多样性提升泛化与适应能力,支持在持续演化的开放世界场景中有效部署。该工作为 3 页短文,已被 IMOL 2025 接收。

  9. arXiv cs.RO 机器人学55

    Inspect Robots:评估具身 AI 能力与安全的开源框架

    作者提出 Inspect Robots,一个用于开发和运行具身智能体评测的模块化开源框架,提供可定制、可复用的物理评测抽象与结果分析能力,并自动化评测的搭建、执行与终止。论文用该框架评测了六个基于前沿语言模型的策略的能力与安全性;该框架发布三个月以来已获得近 100,000 次下载。论文已提交至 CoRL 2026 的 SPAIS Workshop。

  10. arXiv cs.RO 机器人学53

    GAMBIT:学习规划连续多机器人轨迹

    GAMBIT 是一种多机器人连续轨迹规划框架,先通过模仿学习选择协调的运动基元,再用强化学习微调策略,并引入带备份轨迹的安全回滚机制保证全程无碰撞。实验中 GAMBIT 显著优于集中式运动规划器和分布式反应式规划器等基线,在连续域内可协调一千多台机器人,规划时延低于几百毫秒。

  11. arXiv cs.RO 机器人学44

    FAVOR:面向世界动作模型的未来锚定验证与在线恢复框架

    FAVOR 是面向世界动作模型(WAM)的轻量级验证与恢复框架,将 WAM 行动前预测的未来帧保留为锚点,由 Anchor Verifier 比对观测与锚点及已执行动作以标记破坏任务的偏差,再由 Anchor-Guided Recovery 借助视觉语言模型生成简短纠正指令,让 WAM 在强化指令引导下回到预期未来并继续任务。

  12. arXiv cs.RO 机器人学53

    VLA-ZO:面向视觉-语言-动作模型的快速零阶适配框架

    VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。

  13. arXiv cs.RO 机器人学58

    研究揭示 VLA 机器人策略存在视觉接地缺口,任务成功未必遵循指令

    该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。

    推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。

  14. arXiv cs.RO 机器人学55

    面向微型 UAV 的四足机器人定位与主动跟踪方法

    研究者将微型 UAV 的定位栈整体卸载到带 7 自由度机械臂的四足机器人上,由臂端相机检测机载 AprilTag 标记并融合四足自身定位,为裸机 27 g、带标记 42 g 的无人机提供完整 6-DOF 位姿。实验室飞行中外部位姿精度达 12-16 mm,自主飞行与动捕控制相差 2-5 cm。四足主动跟随使跟踪误差从 11.0 cm 降至 6.9 cm。

  15. arXiv cs.RO 机器人学47

    TRABot:为对话式人形机器人整合社交手势与数字人脸并同步语音

    TRABot 是一个基于多智能体的框架,通过运动原子构建、对话生成、运动规划与面部动画四类专用智能体,将语音、面部动画与身体手势整合为连贯响应。系统在物理 G1 人形机器人上部署流式人脸-语音-身体集成系统,结合流式对话音频、音频驱动面部动画与语义规划的身体运动,实现统一实时交互闭环。定量与定性实验显示 TRABot 在自然度、表现力与多模态一致性上取得最佳整体性能。

  16. arXiv cs.RO 机器人学52

    Radar2Plan:面向端到端开环自车轨迹规划的 4D 雷达基准

    Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。

  17. arXiv cs.RO 机器人学51

    闭式传播接触最大值中的高程图不确定性

    研究提出用 Clark 成对递归闭式计算接触最大值的矩,替代一阶传播与 Monte Carlo 采样,用于不确定高程图上的风险感知路径规划。在 317 段留出的 rover 路径上,修正后的 Clark fold 将均值中位误差从线性化的 2.3% 降至 0.19%,并在 90% CVaR 上取得所有方法中最低误差,GPU 上单次基准规划仅 5.5 微秒。

  18. arXiv cs.RO 机器人学55

    Adaptive Mean Flow 实现平滑响应式闭环机器人控制

    Aksel Vaaler 等人提出 Adaptive Mean Flow(AMF),一种基于流匹配的模仿学习方法,用于实现平滑且响应迅速的全闭环机器人控制。AMF 采用 Mean Flow(Flow Matching 的加速形式)降低预测时延,并在预测新动作时引入上一步轨迹的腐蚀版本,信噪比随轨迹时间参数递增,从而抑制相邻步之间的大幅变化。

  19. arXiv cs.RO 机器人学49

    MagServo:基于学习隐式表征的抗不确定性分层磁导航伺服框架

    MagServo 提出一种分层学习框架,直接利用学习到的隐式磁特征实现鲁棒的 6-DoF 磁伺服控制,无需解析磁模型或显式 Jacobian 监督。该框架通过掩码重建学习抗不确定性磁表征,并结合非线性模型预测控制与局部 Jacobian 求逆的分层控制器。物理实验实现 0.386 mm 与 0.479 度的平均终端误差,并在未见过的磁源配置下无需重训练即保持鲁棒性能。

  20. arXiv cs.RO 机器人学47

    Recon2Servo:基于学习式图像到运动推断的机器人超声视觉伺服

    Recon2Servo 提出一种从 B-mode 图像直接学习图像到运动推断的视觉伺服框架,实现超声探头 6-DoF 控制。框架采用带低秩适配的 DINOv3 编码器与双向关系模块估计当前与目标图像间的探头相对位姿,结合监督相对位姿学习、重建引导闭环自适应与有界残差位姿修正。在公开数据集及 12 名健康志愿者采集的内部数据集上验证了重建体伺服效果,并在人体前臂演示目标视图对齐与动态跟踪。

  21. arXiv cs.RO 机器人学47

    P3:面向约束扩散控制的持续粒子规划

    P3 提出一种基于序列蒙特卡洛的扩散控制框架,在重规划步骤间维护加权候选轨迹群体,通过约束感知加权与重采样在不重训扩散模型的前提下满足测试时约束。理论分析表明重加噪深度控制已保留轨迹的路线稳定性,且保留稀有分离路线所需粒子数远少于从头采样。在迷宫导航任务中,P3 相比重新生成群体或约束优化修正单条采样轨迹的方法规划更快,减少路线切换并提升成功率,且每次重规划所需去噪迭代更少。

  22. arXiv cs.RO 机器人学45

    面向医院配送机器人的状态调度控制器:共享人力与基础设施资源建模

    研究提出一种位置感知的状态调度模型,将机器人准入与搬运人员支持、共享电梯、充电和清洁资源耦合,并回放 33,079 条医院配送请求进行评估。在高人力配置场景下,将假设电梯容量从 2 提升到 4,纯人工调度的延迟率从 55.11% 降至 3.18%,超过调度策略差异带来的影响。结果表明机器人通过截止时间准入测试仍可能因人员交接和共享设施延误服务,分析区分了准入、完成与恢复可用三个阶段。

  23. arXiv cs.RO 机器人学45

    ARISE:面向 Sophia 人形机器人的社会推理与具身交互智能体框架

    ARISE 框架在 Sophia 人形机器人上打通社会推理与具身表达,整合多模态上下文理解、长期记忆及反应式与主动式交互,将社会意图转化为与语音和机械面部表情协同的机器人原生手势。流式执行在 Sophia 上的评测显示交互质量与具身行为协调性良好,并显著降低时延。