跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学58

    研究解析行为提示在机器人操作任务中的生效条件

    该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。

    推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。

  2. arXiv cs.RO 机器人学52

    DexPIE:从真实部署经验中稳定提升灵巧操作策略

    DexPIE 在三个真实世界灵巧操作任务上将成功率较基于演示的参考策略提升 37.3%,超过所有基线方法。该后训练框架通过灵巧手适配的干预系统与多阶段 DAgger 式数据采集扩大探索覆盖,并以连续最优性指示器条件化策略,更细粒度地利用数据质量。源代码与数据集将公开发布。

  3. arXiv cs.RO 机器人学52

    Affordance2Action:面向实时操作的任务条件化场景级可供性定位基准

    Affordance2Action(A2A)提出以 A2A-Bench 为核心的场景级任务条件化可供性定位框架,覆盖日常场景中的单区域与多区域指令对应关系。其数据构建管线 A2A-AffordGen 结合语言模型过滤、交互式部件分割、实例级 mask-out 精修、任务推理指令生成与人工校验。

  4. arXiv cs.RO 机器人学49

    双向增量广义混合 A*(Bi-IGHA*)算法论文

    论文提出双向增量广义混合 A*(Bi-IGHA*)算法,通过让对向搜索在低分辨率下绕过被冻结顶点,缓解 IGHA* 的冻结顶点障碍。在 R3、R4、R6 的开环实验中,Bi-IGHA* 相比 IGHA* 显著减少搜索扩展次数,闭环实验在仿真与真实机器人系统上验证了性能与可行性提升。

  5. arXiv cs.RO 机器人学50

    跨空间对称性组合:机器人策略在构型空间与任务空间上的联合等变学习

    论文提出跨空间对称性组合框架,让机器人策略同时对构型空间与任务空间的多个对称性保持等变,借助正运动学映射的微分几何结构实现对称性在两个空间间的下降与提升。在双臂机器人的仿真与真实实验中验证,联合利用多个对称性带来更好的泛化能力,视频与源码已公开。

  6. arXiv cs.RO 机器人学58

    FingerEye:基于连续视觉触觉感知的灵巧操作学习框架

    FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。

    推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。

  7. arXiv cs.RO 机器人学55

    HRDexDB:覆盖人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 发布了一个覆盖人类与 5 种机器人本体的 4D 灵巧抓取数据集,包含 100 种物体上的 3.2K 次抓取试验。数据集通过同步多相机系统与重建管线提供多视角及第一人称 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹与成功/失败标注。基于该数据集,作者演示了人类到机器人的接触图迁移、视觉机器人-物体接触估计与检索辅助抓取三项应用。

  8. arXiv cs.RO 机器人学54

    ReBound:基于重置感知半马尔可夫自举的免重置强化学习敏捷驾驶方法

    ReBound 提出一种面向免重置强化学习的价值学习方法,将导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并从恢复后价值按实际恢复时间折扣进行自举,同时用奖励中心化稳定价值学习。在仿真和 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文共 9 页、6 幅图,以 arXiv:2604.07672 提交。

  9. arXiv cs.RO 机器人学55

    BAT:通过在线策略切换实现人形机器人长时程全身控制的敏捷与稳定平衡

    BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。

  10. arXiv cs.RO 机器人学55

    VLLR:面向长时程机器人任务的可泛化稠密奖励框架(IROS 2026)

    论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。

  11. arXiv cs.RO 机器人学51

    TransMASK:通过学习变换实现掩码状态表示

    TransMASK 提出一种自监督方法,学习一个掩码与观测图像特征相乘,仅保留与任务相关的特征,可与 diffusion policies 等模仿学习框架结合,无需额外标签或修改损失函数。实验表明该掩码具有可解释性,能拒绝干扰物位置、背景颜色等虚假特征,在分布外环境测试中相比基线方法至少提升 30% 的鲁棒性。项目网站已公开。

  12. arXiv cs.RO 机器人学57

    论文提出低成本力控触觉夹爪 TF-Gripper 与力控操作框架 RETAF

    论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。

  13. arXiv cs.RO 机器人学44

    LfH-CP:通过幻觉关键点学习动态环境导航

    论文提出自监督框架 LfH-CP,通过两阶段幻觉关键点生成动态障碍物数据集,无需专家演示或试错探索。该方法先识别障碍物必须出现的时空关键点以形成近最优运动规划,再程序化生成多样轨迹,避免模式坍缩。仿真中基于 LfH-CP 数据集训练的规划器成功率高于既有幻觉方法。

  14. arXiv cs.RO 机器人学55

    EmbodiedSmith:通过递归自我改进飞轮在仿真中规模化生成具身数据

    EmbodiedSmith 提出一个通过递归自我改进(RSI)规模化生成具身数据的框架,将资产、场景与任务生成统一到同一流水线,支持自主创建和语言驱动定制。其核心是智能体式改进回路,场景生成预判下游任务需求,任务生成引导场景定向编辑,使场景与任务迭代互相改进,提升任务生成成功率,包括长时程任务。

  15. arXiv cs.RO 机器人学46

    信念引导的混合控制实现几乎必然的目标集收敛

    一篇 arXiv 论文提出信念引导的双控制算法,将信念空间滚动时域选择与目标集进展函数的期望下降约束结合,证明了决策时刻几乎必然的目标集收敛。在平面调节实验中,两步前瞻选择在 11 次决策内将欧氏状态范数降至 0.01 以下,而短视的单步选择在零输入后立即失去可容许性。在模拟双臂装配任务中,该算法相对参考跟踪基线将无穷范数相对位置误差降低 96.4%。

  16. arXiv cs.RO 机器人学47

    JEPA 世界模型通过逆动力学保留不稳定模态

    JEPA 世界模型训练中加入动作重建(逆动力学损失)目标,可保证编码器在有限时域可达子空间上为单射,从而保留对控制至关重要的不稳定模态。论文证明精确动作重建使编码器不丢弃任何 H 步内可达的状态方向,且有限时域可控性 Gramian 的主特征空间随 H 增大收敛到可控不稳定子空间。

  17. arXiv cs.RO 机器人学47

    基于 Ackermann 转向移动机器人的视觉语言导航 Sim-to-Real 迁移

    一项研究将视觉语言导航(VLN)从仿真环境迁移到真实世界,在自建的 Ackermann 转向移动机器人上实现离线导航。该系统采用 Cross-Modal Attention(CMA)架构,通过线性光度调整和少量真实数据微调完成域适应,无需导航图或全景视图。实验以 SPL 和 nDTW 指标评估,验证了方法的鲁棒性与适应性。

  18. arXiv cs.RO 机器人学55

    R2RI:首个面向机器人间交互的多视角 Event 与 RGB 数据集

    R2RI 是首个专为机器人间交互(RRI)任务设计的数据集,包含多款人形机器人基于真实人类社交行为建模的交互场景,提供各机器人机载传感器的第一人称视角与外部固定相机的第三视角。数据集涵盖 Event 与 RGB 两种模态,规模超过 6.5M 帧、约 5000 段视频,帧率达 120 fps,已公开发布全部任务与模态的数据及标注,并对比了两种模态在多项感知与交互任务上的表现。

  19. arXiv cs.RO 机器人学42

    面向未来工程师的 LLM 教学:一场可扩展的机器人导航工作坊

    一项面向工程硕士生的可扩展游戏化工作坊在 10 场次中让 226 名学生通过移动网页界面为非推理与推理 LLM 编写提示词,完成复杂度递增的网格导航任务,系统返回机器人可执行计划、轨迹可视化与自动评分,并在 Boston Dynamics Spot 机器人上进行现场演示。

  20. arXiv cs.RO 机器人学58

    QF3:用过滤 Q 梯度加速流策略强化学习的人形运动控制算法

    论文提出 QF3(Fast Flow RL with Filtered Q-Gradients),一种在线离策略 RL 算法,通过 flow matching 加上 critic 的动作梯度、经一步预测反向传播来训练流策略,且只将 critic 梯度施加于接近回放动作的那些动作维度。

    推荐理由:论文给出相对 FPO++ 的 10x 训练加速和零样本上机结果,可评估该算法是否值得在人形运动控制任务中试用。

  21. arXiv cs.RO 机器人学54

    PEARS:基于失败推理与扩散引导的触觉操作高效自适应框架

    PEARS 提出一种物理先验引导的混合强化学习框架,用于带触觉反馈的预训练机器人策略在线自适应。仿真中 PEARS 较最强单任务基线将成功率提升 12.4-37.4 个百分点,达到同等成功阈值所需交互回合数最多减少 53.2%。真实实验中,PEARS 在白板擦除任务上达到 95% 成功率,在移液器吸取任务上达到 90%。

  22. arXiv cs.RO 机器人学58

    DepthWorld:面向机器人操作的3D世界模型

    DepthWorld 提出一种结合学习式立体深度与联合因子图的标定流程,将 DROID 数据集标定为提供稠密度量深度和多视角外参的 DROID-3D,外部相机在 90% 的 episode 上重投影误差 <0.7 px。

    推荐理由:论文解释了RGB-only世界模型几何不一致的成因,并给出可迁移的标定与深度监督思路。

  23. arXiv cs.RO 机器人学40

    面向社交机器人语音对话的可扩展基准

    一项面向社交机器人语音对话的可扩展基准被提出,用于评估澄清请求、打断、具身信号(如点头或面部提示)和时间约束等常见对话问题。该基准同时提出采用实时通信框架 Retico,以满足机器人语音对话能力的技术要求。研究已被 IROS 2026 Workshop on Human-Robot Dialogue 接收并展示。

  24. arXiv cs.RO 机器人学54

    EgoLAP:通过语言-动作推理从第一人称人类数据中学习的 VLA 预训练框架

    EgoLAP 提出一种 VLA 预训练框架,通过共享的语言动作链式思维联合学习人类与机器人轨迹,将运动意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的真实任务平均进度,较其他动作表示方式取得 2.3x 性能提升。运动级推理也优于结合子任务、目标框与视觉轨迹的复合推理格式。

  25. arXiv cs.RO 机器人学45

    Fast Non-Parametric Heteroscedastic Imitation Learning With Geometric Priors:带几何先验的快速非参数异方差模仿学习

    arXiv 论文提出一种带几何先验的非参数异方差模仿学习方法,用于从人类示教中学习概率策略,优化后的公式使包含位置与姿态的轨迹更新耗时低于 3 ms。该方法采用非可分对角核捕捉同一自由度间的不确定性关系,支持流形值输入与大角度姿态变化的流形值输出,并可通过任务参数化适配不同物体位姿。作者在玩具示例与真实机器人操作任务上进行了自主执行和共享控制场景的评测。

  26. arXiv cs.RO 机器人学47

    RIWANav:面向城市导航的世界-动作模型递归自改进框架

    RIWANav 提出一种后训练框架,将世界模型与动作模型(策略)的耦合适配建模为任务特定的递归自改进(RSI):世界模型通过想象结果为 GRPO 提供比较反馈,改进后的策略再按行为新颖度与预测误差构建自课程,筛选与专家一致的动作-视频对来精炼世界模型,闭合递归自改进循环。实验显示 RIWANav 优于训练基线与已有方法,真实场景试验也验证了其实际可用性。