跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学55

    CLRE:面向学习型驾驶规划器的闭环精修与执行框架

    CLRE 提出一种分层滚动时域控制框架,在冻结上游规划器、不引入新学习模型的前提下,通过有限时域最优控制与预测条件 OBB 可行性测试筛选候选轨迹,下层结合距离速度上限与饱和比例制动律执行。在 Bench2Drive 220 条路线验证集上以 VAD 为上游规划器闭环仿真,驾驶得分从 42.26 提升至 55.89,路线完成率从 55.69 提升至 71.51,碰撞事件从 117 降至 97。

  2. arXiv cs.RO 机器人学49

    CoDimRecon:用可变形曲线、曲面与体重建仿真就绪 3D 场景的智能体框架

    CoDimRecon 提出一个智能体框架,从多视角 RGB 观测重建包含刚性、铰接与可变形物体的可编辑仿真就绪 3D 场景。可变形物体按维度重建为带半径的中心线曲线、带厚度的流形壳曲面和用于体网格化的水密实体,智能体引导的行为测试会暴露不匹配并触发针对性修订。在 Replica 与 ScanNet++ 场景上取得有竞争力的组合重建精度,并演示了三类表示下的机器人交互,包括促使塑性弯曲的折纸案例。

  3. arXiv cs.RO 机器人学55

    FIRE3D:一分钟内前馈式交互 3D 场景重建框架

    FIRE3D 提出统一框架,将单张 RGB 图像或随手视频在 1 分钟内(含预处理)转换为最多 12 个带纹理实例的可交互 3D 场景资产。其前馈推理管线从 RGB 捕获估计的 posed RGB-D 观测预测组合式场景表示,输出每个检测物体的 6-DoF 位姿、包围盒、mesh 与纹理,无需测试时优化。该框架在评测基准上取得领先的检测精度、强几何重建与有竞争力的渲染质量,并显著快于对比重建系统。

  4. arXiv cs.RO 机器人学45

    迈向可信物理智能:全生命周期的理论与实践

    该综述提出可信物理智能(T-PAI)理论框架,系统梳理物理智能在物理安全、信息物理安全与制造过程等方面的可信挑战。研究沿五个核心阶段追踪物理智能端到端生命周期,提出可信物理智能操作化方法 T-PAIO,并组织关键可信原则,为治理可信物理智能系统提供理论基础。

  5. arXiv cs.RO 机器人学49

    IBPA:通过增量 Ball Pivoting 与集成孔洞检测实现实时自由曲面流形网格重建

    IBPA 将 Ball Pivoting Algorithm 改造为增量式实时自由曲面重建方法,从流式点云数据中构建可定向流形网格,无需假设点云重叠或空间分布,并集成孔洞检测机制以高亮不完整网格区域。相比 DTM 等高度场表示,IBPA 支持悬垂与垂直结构等更复杂表面拓扑,适用于 ROV 与 AUV 水下测深数据采集时的实时覆盖可视化。参考实现源码将在预印本上线后公开。

  6. arXiv cs.RO 机器人学51

    LoopVLA:面向循环任务执行的跨子任务事件记忆接口

    LoopVLA 提出跨子任务事件记忆接口,将刚完成的子任务压缩为记忆供下一子任务的动作专家调用,以支持重复执行与停止决策。可学习事件隐变量查询已闭合片段的 token,动作特征查询历史与联合历史-事件上下文,两路读出经残差融合注入动作头。在记忆基准上,LoopVLA 配合在线子目标预测在重复任务组取得 80.22% 成功率,整体成功率优于强记忆基线。

  7. arXiv cs.RO 机器人学60

    Flash-WAM 提出模态感知步蒸馏,将世界动作模型推理压缩到单步

    Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。

    推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。

  8. arXiv cs.RO 机器人学55

    DyQ-VLA 提出面向运行时误差的 VLA 动态量化框架

    DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。

  9. arXiv cs.RO 机器人学57

    Same Pieces, Different Servers:面向"服务化"AI Agent 的 Tetris 基准测试

    研究者提出 Tetris 基准,用同一组方块、以 oracle 评分衡量 AI Agent 从"服务化"模型获得的决策质量。在一家 serverless 供应商上对 9 个开源权重模型做 5 组预设实验,并自托管一个开源决策模型跑在 CPU 上,发现价格与模型规模不预测决策质量;重发历史在缓存输入免费时几乎零成本,若不免费则贵 11-12 倍且让棋局变差。

  10. arXiv cs.RO 机器人学52

    AVS:面向异构自动驾驶数据流的车载计算型数据管理系统

    AVS 是一套分层车载数据管理系统,通过模态与任务感知预处理、分块索引追加式日志和 SSD-HDD 冷热分层,把瞬态多模态流压缩为可查询的长期历史。在真实 L4 平台三天 LiDAR、相机、GPS 并发日志上,存储较原始 rosbag2 减少 8.0-8.7x,SSD 热层查询 TTFB 0.9-9.1 ms、HDD 冷层 25.6-44.0 ms。

  11. arXiv cs.RO 机器人学44

    EndoWave:基于有理小波的 4D Gaussian Splatting 内窥镜重建方法

    EndoWave 提出统一时空 Gaussian Splatting 框架,在 4D 域直接优化高斯基元,并引入光流几何约束与多分辨率有理正交小波监督,以应对内窥镜场景的光度不一致、非刚性组织运动和视角相关高光。在 EndoNeRF 与 StereoMIS 两个真实手术数据集上,EndoWave 的重建质量与视觉精度相比基线方法达到 state-of-the-art 水平。

  12. arXiv cs.RO 机器人学55

    开放世界全景分割:Con2MAV 方法与 PANIC 自动驾驶基准

    提出开放世界全景分割方法 Con2MAV,可在测试时发现新语义类别与新物体实例,并保持增量发现类别间的一致性,在道路到水下多类数据集上展现开放世界分割能力与已知类别竞争力。同时发布自动驾驶异常分割基准 PANIC,含 800 张图像、50 多个未知类别、4,000 多个物体实例及像素级语义与实例标注,并提供隐藏测试集竞赛。实现将在录用后开源,论文已被 IJRR 接收。

  13. arXiv cs.RO 机器人学57

    InterEvolve 提出奖励程序测试时进化方法用于人形机器人 loco-manipulation

    Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。

  14. arXiv cs.RO 机器人学55

    UniWAM:融合物理推理、世界生成与动作预测的统一世界-动作模型

    UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。

  15. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  16. arXiv cs.RO 机器人学53

    Token-World:在视觉-语言模型 Token 空间进行世界建模以实现机器人操作

    Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。

  17. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  18. arXiv cs.RO 机器人学55

    DODGER:面向动态障碍物机器人导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。

  19. arXiv cs.RO 机器人学55

    RoboActualizer 论文提出在冻结世界模型上以 60M 参数生成机器人动作

    论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。

  20. arXiv cs.RO 机器人学41

    LQR-ArUco 融合:面向两轮机器人导航与非对称操作的鲁棒分层控制

    提出 LQR-ArUco 融合的分层控制框架,解决两轮倒立摆(TWIP)机器人在非对称物体操作中的动态失稳与导航漂移。机外视觉系统跟踪 ArUco 标记提供高时延全局航点导航以绕开里程计漂移,机载低时延控制环用惯性与编码器数据抑制扰动。实测中该双环方案让自制机器人准确导航、抵御减速带冲击、适应动态跷跷板坡道并稳定搬运负载。

  21. arXiv cs.RO 机器人学44

    CoBrush:面向人机协同绘画的分层规划框架

    CoBrush 提出一种分层规划框架,把多轮人机协同绘画拆解为语义、空间与执行三层协调过程,将高层意图推断与空间定位、笔触级控制分离,支持在真实丙烯画布上渐进式构建复杂场景。真实人机绘画会话、压力测试与用户研究表明,相比单轮基线,CoBrush 在语义对齐、空间推进稳定性与机器人动作合理性上更优。该工作已被 IROS 2026 接收。

  22. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。

  23. arXiv cs.RO 机器人学54

    面向基于模型机器人设计的大语言模型

    研究提出用大语言模型构建显式工程模型的机器人设计框架,将物理关系、兼容性约束与目标显式化后再做多目标优化,以获得可行性与 Pareto 最优保证。在四旋翼与循迹小车选型问题上,30 次直接由 LLM 生成的设计试验无一能通过最终模型的可行性验证。与独立专家模型及多轮模型细化的对比显示,建模假设变化会显著改变预测的可行与 Pareto 最优设计集合。

  24. arXiv cs.RO 机器人学55

    Rolling-WAM:用滚动想象实现世界动作模型

    Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。