跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学53

    IronMan:面向机器人操作的信息约束视频-动作学习框架

    IronMan 提出基于信息瓶颈原则的视频-动作学习框架,通过动力学感知瓶颈抑制无关视觉信息、保留动作相关动态线索。在 LIBERO 上达到 99.0% 成功率、RoboTwin clean2clean 上达到 79.4%,均超过所有评测基线。在 OOD 偏移下,LIBERO-Plus 成功率 79.1%,比最强基线高 10.4 个百分点。

  2. arXiv cs.RO 机器人学58

    SALT:让 VLA 模型在执行中适应未知视觉干扰

    SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。

  3. arXiv cs.RO 机器人学59

    OpenWAM:面向可组合世界-动作模型的开放框架

    OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。

    推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。

  4. arXiv cs.RO 机器人学53

    ESP:面向单步多模态动作生成的 Energy-Score Policy

    ESP(Energy-Score Policy)提出一种免蒸馏方法,用单次网络评估将策略上下文与噪声直接映射为动作块,动作头以 energy score 而非均方误差训练,实现对多模态动作分布的直接学习。仿真与真实操作任务实验显示,其任务成功率与 flow matching 基线相当,而动作生成时延大幅降低。

  5. arXiv cs.RO 机器人学58

    SMART:大规模合成预训练实现关节物体操作的零样本 sim-to-real 迁移

    SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。

    推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。

  6. arXiv cs.RO 机器人学55

    OntoPlan:基于本体的场景表示与智能体框架,实现可扩展的机器人任务规划

    NeurIPS 2026 接收的论文提出 OntoPlan,一个基于本体场景表示的智能体框架,用于机器人任务规划。在覆盖 5 个室内环境、3 种场景规模的 150 项通用任务上,OntoPlan 平均任务成功率达 0.89,最强基线仅 0.27;平均每任务消耗 18.1k tokens,约为最高效基线的 1/5.6。场景规模增大时优势保持,且能对模糊或不可行指令追问或报告信息不足。

  7. arXiv cs.RO 机器人学55

    TacZero:用通用视觉-语言模型与触觉反馈实现免训练的插孔操作

    TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。

  8. arXiv cs.RO 机器人学52

    OpenSplatGraph:从稠密语义地图构建结构化场景图,实现开放词汇机器人感知

    OpenSplatGraph 提出一个统一框架,直接从在线 Gaussian 开放词汇语义地图构建持久化 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件化的对象提取,并将对象实例关联到持久图节点以增量更新属性与关系。该框架在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的在线开放词汇感知与下游任务性能,已被 ACCV 2026 接收。

  9. arXiv cs.RO 机器人学51

    VLM 引导的电磁数字孪生在线标定 Demo:Unitree G1 实测 20 m 内电导率误差 1.74×10⁻⁴

    该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。

  10. arXiv cs.RO 机器人学51

    LoopVLA:面向循环任务执行的跨子任务事件记忆接口

    LoopVLA 提出跨子任务事件记忆接口,将刚完成的子任务压缩为记忆供下一子任务的动作专家调用,以支持重复执行与停止决策。可学习事件隐变量查询已闭合片段的 token,动作特征查询历史与联合历史-事件上下文,两路读出经残差融合注入动作头。在记忆基准上,LoopVLA 配合在线子目标预测在重复任务组取得 80.22% 成功率,整体成功率优于强记忆基线。

  11. arXiv cs.RO 机器人学60

    Flash-WAM 提出模态感知步蒸馏,将世界动作模型推理压缩到单步

    Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。

    推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。

  12. arXiv cs.RO 机器人学55

    DyQ-VLA 提出面向运行时误差的 VLA 动态量化框架

    DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。

  13. arXiv cs.RO 机器人学57

    InterEvolve 提出奖励程序测试时进化方法用于人形机器人 loco-manipulation

    Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。

  14. arXiv cs.RO 机器人学55

    UniWAM:融合物理推理、世界生成与动作预测的统一世界-动作模型

    UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。

  15. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  16. arXiv cs.RO 机器人学53

    Token-World:在视觉-语言模型 Token 空间进行世界建模以实现机器人操作

    Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。

  17. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  18. arXiv cs.RO 机器人学55

    DODGER:面向动态障碍物机器人导航的安全引导强化学习框架

    DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。

  19. arXiv cs.RO 机器人学55

    RoboActualizer 论文提出在冻结世界模型上以 60M 参数生成机器人动作

    论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。

  20. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。

  21. arXiv cs.RO 机器人学55

    Rolling-WAM:用滚动想象实现世界动作模型

    Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。

  22. arXiv cs.RO 机器人学55

    基于学习的工业机械臂操作后门攻击:一项实证安全研究

    研究在 FANUC 与 xArm 两台真实商用工业机械臂上实证评估了基于学习的机械臂操作后门攻击与防御,验证后门可在常规任务执行中保持隐蔽、仅在特定触发器出现时诱导语义错误的抓取行为。作者提出一种在线防御流程,在运行时检测并中和触发器,并与离线微调防御对比效果。评估还测量了防御流程引入的计算时延与执行开销,以判断其是否适用于高吞吐工业场景。

  23. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。