跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学49

    KineWorld:面向具身世界建模的动作诱导传输场

    KineWorld 提出传输感知世界建模框架,把机器人运动学从动作条件扩展到生成监督的空间分配,通过 Kinematic Transport Lifting(KTL)构建渲染器派生、相机对齐的传输场,并用 Transport-Aware World Diffusion(TAWD)在视频潜空间网格上校准运动支撑、重加权未来 RGB 流匹配。

  2. arXiv cs.RO 机器人学54

    EpicWorldModel:基于隐空间世界模型的探索驱动规划

    EpicWorldModel 用 flow-matching 目标训练随机 JEPA,在部分可观测、存在遮挡的环境中直接预测多个潜在未来状态,并以 flow 预测方差作为探索信号融入 CEM 规划。隐空间规划实验中该方法在各任务上取得最佳或持平表现,成功率较 LeWorldModel 最高提升 22%。论文已被 NeurIPS 2026 接收。

  3. arXiv cs.RO 机器人学47

    RADPO:面向安全的可达性感知扩散策略优化方法

    RADPO 提出一种免模型的扩散策略优化方法,将预测首达安全估计与累积成本预算反馈结合,用于安全感知的连续控制强化学习。该方法学习折扣首达可达性值来塑造奖励,并用对偶式乘子按实际回合成本相对预算调整塑形强度,无需学习动力学模型、动作梯度或反向扩散采样器求导。在十项连续控制安全任务上,RADPO 取得有竞争力的奖励-成本权衡,多个任务的约束违反显著低于对比基线。

  4. arXiv cs.RO 机器人学47

    未知输入非线性系统的结构基础:UID 诱导正规形与最小传感 Structure-from-Motion

    该研究首次给出未知输入驱动的非线性系统状态估计的通用结构解,提出 UID 诱导正规形,将未知输入信息分解为与可观测动力学结构解耦的方向和完全表征其影响的可观测量,无需对未知输入作模型或随机假设即可统一实现解耦与重构。在最小 Structure-from-Motion 配置中,仅用 3 个点特征和单轴陀螺仪即可递归估计状态,恢复三维结构与相机运动(差一个未知全局尺度因子),真实数据实验验证了可行性。

  5. arXiv cs.RO 机器人学58

    OGAM 论文提出基于物体注意力监控的 VLA 策略运行时保障方法

    论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。

    推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。

  6. arXiv cs.RO 机器人学49

    可控道路标线生成

    提出可控道路标线生成方法,从可行驶区域掩码、外环标线与文本描述合成缺失的中心区域标线布局,输出车道分隔线、道路分隔线与人行横道三类通道。系统采用文本条件 BEV 潜空间 rectified-flow DiT,配合拓扑感知辅助损失与免训练的 Structured Gaussian Render 后处理。

  7. arXiv cs.RO 机器人学49

    StageVLN:面向高效视觉语言导航的空间与轨迹辅助引导

    StageVLN 提出一种训练框架,用冻结的几何基础模型提供多级空间引导,并以相对朝向与专家路线进度目标补充轨迹状态监督,辅助组件仅在训练期使用、部署时移除。在 R2R-CE validation-unseen 上,StageVLN 以 4B 参数骨干取得 56.3% SR 与 51.4% SPL,推理阶段无需额外几何编码器;在 RxR-CE 上取得 54.3% SR,且不引入额外导航训练数据。

  8. arXiv cs.RO 机器人学44

    面向安全规范的场景化组合式统计模型检验框架

    该框架将复合场景分解为原始场景、将规范分解为子规范,独立验证每个原始场景后用重要性采样与核密度估计组合统计估计,用于安全与 co-safety 规范的高效分析。实验评估显示,它能准确回答此前未见复合场景的验证查询,并通过并行化与轨迹复用降低仿真成本。该工作为 RV 2026 论文的扩展版本。

  9. arXiv cs.RO 机器人学52

    Feasible-Future Decoding:让视觉-语言-动作策略在安全之外还可行

    VICS-G 通过可行未来解码在冻结的视觉-语言-动作(VLA)策略上重排候选动作,在 Safety-CHORES 的六项设置中将平均累计安全成本降低 1.9%-57.5%,成功率与策略采样相比保持在 2.5 个百分点以内,平均回合长度相差 0.82 步。该方法以报警触发、免训练的重排器形式实现,无需重训基础策略,也无需在线轨迹 rollout。

  10. arXiv cs.RO 机器人学45

    面向在线目标条件强化学习的方向条件策略(DCP)

    提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。

  11. arXiv cs.RO 机器人学58

    研究刻画 VLA 工作负载特性,指导具身 AI 系统设计

    一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。

    推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。

  12. arXiv cs.RO 机器人学37

    在部分可观测动态博弈中针对未知对手编排 Level-K 策略

    研究将 Level-K 策略库的部署问题建模为部分可观测马尔可夫博弈中的动态编排,比较基于分类的编排器(CBO,使用离线数据或 on-policy 数据聚合训练)与强化学习编排器(RLBO)。在追逃实验中,on-policy 训练提升分类与回报,但 RLBO 回报高于 on-policy 与离线 CBO。给定预训练策略库,RLBO 以更少训练步数达到与直接在追逃者动作空间上训练的策略相当的性能。

  13. arXiv cs.RO 机器人学44

    手持手机上的概率化行人预测:世界坐标系热力图、视觉惯性高度漂移与无真值评估

    研究者构建并评估了一套仅用单目相机与视觉惯性里程计(VIO)的手持行人预测系统,将检测到的人通过射线-平面交点抬升到地面,在重力对齐的度量坐标系中跟踪,并用小型 U-Net 以负对数似然(NLL)损失输出逐步概率热力图。

  14. arXiv cs.RO 机器人学44

    基于多项式代理网络的可微分三值时序逻辑语义

    提出一种三值时序逻辑的概率松弛方法,通过多项式代理网络在同一网络中同时计算数值与梯度,并在真实数据上保留精确判定。该松弛网络可作为梯度控制综合的目标函数,支持离线与在线机器人控制。研究在两个机械臂任务上验证,涉及子任务的中间检查与排序,展示了正确且及时执行的效果。

  15. arXiv cs.RO 机器人学47

    面向多智能体空间覆盖的非线性密度驱动最优控制(D2OC):基于序列凸规划

    研究者将密度驱动最优控制(D2OC)扩展到离散时间控制仿射非线性系统的多步有限时域控制,通过序列凸规划在每个控制更新时对非线性动力学局部线性化,得到保留 Wasserstein 重心结构并直接纳入输入约束的严格凸二次规划。论文还给出受约束控制偏差与非线性 Taylor 余项下的有限时域误差界及滚动时域两步特化。独轮车与四旋翼团队仿真显示其覆盖性能与非线性模型预测控制相当,同时显著缩短计算时间。

  16. arXiv cs.RO 机器人学49

    RAGrasp:几何-语义模板检索与抓取迁移

    RAGrasp 提出一种检索增强的平面平行夹爪抓取流水线,仅用本地采集的少量带抓取标注 RGB-D 模板即可适配新物体,无需端到端重训练。系统用 DINOv2 视觉特征与外观、深度线索驱动 SAM2 分割查询物体,经两阶段几何-语义检索级联选模板,再由置信度门控选择抓取迁移估计器并做约束细化。真实试验中对已见物体 20/20、未见物体 19/20 抓取成功。

  17. arXiv cs.RO 机器人学36

    预算约束移动故障模型下自主机器人的容错互见问题

    研究提出一种确定性分布式算法,解决 n≥3 个不透明自主移动机器人在预算约束移动故障模型下的互见问题,允许任意数量机器人因移动故障永久失能。算法在 SSYNC 模型、非刚性移动、仅共享固定参考点的条件下运行,保证非故障机器人有限时间内互见全部机器人,遵守每个机器人的移动预算并实现无碰撞移动,仅使用 12 种光色。

  18. arXiv cs.RO 机器人学47

    迭代式奖励设计全景:BIRD 基准统一评测 LLM 奖励函数生成方法

    研究者提出迭代式奖励设计基准 BIRD,将现有 LLM 奖励代码生成与迭代改进方法统一到同一配置与评测空间,便于直接对比、消融设计选择。在 MuJoCo、Meta-World、Assistax、HumanoidBench 上,少量简单设计选择持续提升性能,组合后显著优于先前方法。代码已开源。

  19. arXiv cs.RO 机器人学45

    有损编码器何时能给出可迁移的安全证书:Latent Safety Filters 分析

    研究给出有损编码器下 latent safety filter 安全证书可迁移到物理系统的判据:被丢弃的安全相关动力学的可检测性决定证书是否存在。构造出 latent 模型精确、latent 信号恒报安全而物理状态可任意不安全的系统,此时无证书存在且编码器下游监视器无法检测失效。

  20. arXiv cs.RO 机器人学51

    面向开放世界更安全自动驾驶的双过程方法

    该框架将神经网络直觉规划与模型预测控制推理规划结合,通过元认知组件依据知识图谱与风险场在两者间切换。在 CARLA 中针对(应急)车辆闯红灯的分布外场景测试,相比纯神经网络规划器将碰撞数减少 89%,并提升对特殊路权规则的遵守。论文已被 IEEE ITSC 2026 接收。

  21. arXiv cs.RO 机器人学57

    通过流固耦合实现触觉感知的无电子软体触觉传感器

    研究者利用流固耦合开发出一类传感端完全不含电子元件的软体触觉传感器,仅用两个外部压力传感器连接充液弹性通道,通过黏性流体位移产生的压力模式编码触碰位置与力。机器学习框架结合特征提取、软聚类与自适应神经模糊推理实现定位与力估计,并在 1D 线性传感器上验证后用空间填充曲线扩展到 2D 触觉映射。该方案在水下或强磁干扰等常规电子传感器易失效的环境中依然有效。

  22. arXiv cs.RO 机器人学55

    InterMimicGen 通过自进化动作模仿扩展人形机器人 loco-manipulation

    研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。

  23. arXiv cs.RO 机器人学55

    RV-ICL:面向智能体机器人的递归视频上下文学习

    RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。