跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学52

    运行时用时序逻辑组合学习型机器人行为

    研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。

  2. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  3. arXiv cs.RO 机器人学51

    Mask2Real-WM:以分割掩码作为 Sim-to-Real 桥梁的可控灵巧世界模型

    Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。

  4. arXiv cs.RO 机器人学58

    SVA 框架将树搜索蒸馏为动作评估器,提升冻结 VLA 模型的泛化能力

    论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。

    推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。

  5. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  6. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  7. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。

  8. arXiv cs.RO 机器人学56

    TDC:面向接触密集操作的仿真到现实可迁移方向柔顺控制

    浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。

  9. arXiv cs.RO 机器人学47

    TRACER:面向可变形物体区域定位的纹理鲁棒可供性思维链框架

    TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。

  10. arXiv cs.RO 机器人学49

    KineWorld:面向具身世界建模的动作诱导传输场

    KineWorld 提出传输感知世界建模框架,把机器人运动学从动作条件扩展到生成监督的空间分配,通过 Kinematic Transport Lifting(KTL)构建渲染器派生、相机对齐的传输场,并用 Transport-Aware World Diffusion(TAWD)在视频潜空间网格上校准运动支撑、重加权未来 RGB 流匹配。

  11. arXiv cs.RO 机器人学54

    EpicWorldModel:基于隐空间世界模型的探索驱动规划

    EpicWorldModel 用 flow-matching 目标训练随机 JEPA,在部分可观测、存在遮挡的环境中直接预测多个潜在未来状态,并以 flow 预测方差作为探索信号融入 CEM 规划。隐空间规划实验中该方法在各任务上取得最佳或持平表现,成功率较 LeWorldModel 最高提升 22%。论文已被 NeurIPS 2026 接收。

  12. arXiv cs.RO 机器人学58

    OGAM 论文提出基于物体注意力监控的 VLA 策略运行时保障方法

    论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。

    推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。

  13. arXiv cs.RO 机器人学49

    StageVLN:面向高效视觉语言导航的空间与轨迹辅助引导

    StageVLN 提出一种训练框架,用冻结的几何基础模型提供多级空间引导,并以相对朝向与专家路线进度目标补充轨迹状态监督,辅助组件仅在训练期使用、部署时移除。在 R2R-CE validation-unseen 上,StageVLN 以 4B 参数骨干取得 56.3% SR 与 51.4% SPL,推理阶段无需额外几何编码器;在 RxR-CE 上取得 54.3% SR,且不引入额外导航训练数据。

  14. arXiv cs.RO 机器人学52

    Feasible-Future Decoding:让视觉-语言-动作策略在安全之外还可行

    VICS-G 通过可行未来解码在冻结的视觉-语言-动作(VLA)策略上重排候选动作,在 Safety-CHORES 的六项设置中将平均累计安全成本降低 1.9%-57.5%,成功率与策略采样相比保持在 2.5 个百分点以内,平均回合长度相差 0.82 步。该方法以报警触发、免训练的重排器形式实现,无需重训基础策略,也无需在线轨迹 rollout。

  15. arXiv cs.RO 机器人学45

    面向在线目标条件强化学习的方向条件策略(DCP)

    提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。

  16. arXiv cs.RO 机器人学58

    研究刻画 VLA 工作负载特性,指导具身 AI 系统设计

    一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。

    推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。

  17. arXiv cs.RO 机器人学44

    基于多项式代理网络的可微分三值时序逻辑语义

    提出一种三值时序逻辑的概率松弛方法,通过多项式代理网络在同一网络中同时计算数值与梯度,并在真实数据上保留精确判定。该松弛网络可作为梯度控制综合的目标函数,支持离线与在线机器人控制。研究在两个机械臂任务上验证,涉及子任务的中间检查与排序,展示了正确且及时执行的效果。

  18. arXiv cs.RO 机器人学55

    InterMimicGen 通过自进化动作模仿扩展人形机器人 loco-manipulation

    研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。

  19. arXiv cs.RO 机器人学55

    RV-ICL:面向智能体机器人的递归视频上下文学习

    RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。