跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。

  2. arXiv cs.RO 机器人学54

    GraRe:面向冻结 6-DoF 抓取检测器的抓取候选重排序方法

    GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。

  3. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  4. arXiv cs.RO 机器人学51

    Mask2Real-WM:以分割掩码作为 Sim-to-Real 桥梁的可控灵巧世界模型

    Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。

  5. arXiv cs.RO 机器人学56

    面向真实机器人五球杂耍的任务误差残差学习

    通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。

  6. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  7. arXiv cs.RO 机器人学43

    强化学习结合有界极值搜索提升机器人控制在分布偏移下的鲁棒性

    该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。

  8. arXiv cs.RO 机器人学56

    TDC:面向接触密集操作的仿真到现实可迁移方向柔顺控制

    浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。

  9. arXiv cs.RO 机器人学47

    TRACER:面向可变形物体区域定位的纹理鲁棒可供性思维链框架

    TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。

  10. arXiv cs.RO 机器人学52

    消除抓取任务中的夹爪状态歧义:伪触觉反馈实现纯仿真学习

    研究提出用伪触觉作为反馈消除抓取操作任务中的夹爪状态歧义,使模仿学习策略可完全在仿真中训练。该方法受力控夹爪充当触觉传感器的思路启发,为策略提供无噪声的二值夹爪状态观测,无需额外数据采集或硬件改动。三项真实抓取任务实验验证了其必要性、有效性与高效性,成果已被 IROS 2025 接收。

  11. arXiv cs.RO 机器人学47

    螺旋几何结合多臂老虎机:增量获取示教以生成机器人操作规划

    研究提出让机器人逐条主动索取运动学示教的方法,用螺旋几何表示从示教生成操作规划并使示教充分性可度量,结合基于 PAC-learning 的多臂老虎机采样策略评估任务空间子区域的规划能力,并用启发式从薄弱区域追加示教。22 名无机器人背景参与者在倒水和舀取两项任务上的用户研究表明,少于 10 条示教即可教会机器人规划任务。成果发表于 2026 IEEE ICRA。

  12. arXiv cs.RO 机器人学49

    RAGrasp:几何-语义模板检索与抓取迁移

    RAGrasp 提出一种检索增强的平面平行夹爪抓取流水线,仅用本地采集的少量带抓取标注 RGB-D 模板即可适配新物体,无需端到端重训练。系统用 DINOv2 视觉特征与外观、深度线索驱动 SAM2 分割查询物体,经两阶段几何-语义检索级联选模板,再由置信度门控选择抓取迁移估计器并做约束细化。真实试验中对已见物体 20/20、未见物体 19/20 抓取成功。

  13. arXiv cs.RO 机器人学55

    InterMimicGen 通过自进化动作模仿扩展人形机器人 loco-manipulation

    研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。

  14. arXiv cs.RO 机器人学31

    面向开放环境中稳健抓取操作的 Quality-Diversity 方法

    研究提出用 Quality-Diversity(QD)算法解决开放环境中的机器人抓取操作任务,高效发现多种稳健抓取构型,作为在铰接物体上生成多样化操作轨迹的可靠起点。操作行为的多样性提升泛化与适应能力,支持在持续演化的开放世界场景中有效部署。该工作为 3 页短文,已被 IMOL 2025 接收。

  15. arXiv cs.RO 机器人学58

    Mulligan 提出面向机器人在机学习的性能引导数据采集方法

    Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。

    推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。

  16. arXiv cs.RO 机器人学47

    面向不确定环境下柔顺抓取的虚拟模型控制

    研究提出六种虚拟模型设计方法,用于力控机械臂在含障碍与不确定性的环境中完成抓取任务。在一台力控 8 自由度人形机器人上开展三项实验,测试可预测性、对外力的敏感度以及对已知和未知障碍的适应性。结果显示该方法虽牺牲精度与轨迹最优性,但能以直观、可扩展的方式设计复杂抓取动作。

  17. arXiv cs.RO 机器人学49

    TacGELLO:为 3D 打印遥操作主手提供触觉接触反馈

    TacGELLO 利用 3D 打印主手已有的舵机,在夹爪扳机处提供触觉接触反馈,并在臂关节处提供基于电流的负载提示。AnySkin 接触检测触发扳机位置保持,跟随臂关节电流变化调整主手舵机输出限值以在抬升时产生阻力。在一名操作者完成的 6 次 UR3 会话中,发送指令跟踪误差为 0.15–0.36° RMSE,轨迹滞后 82–98 ms,62 个抓取区间中有 60 个记录到触觉触发。

  18. arXiv cs.RO 机器人学45

    基于数字孪生的 AR 遥操作接口用于灵巧操作:Now You Feel It, Now You See Me

    提出一种基于数字孪生的 AR 遥操作接口,融合裸手追踪、双手机器手与机器人/任务物体的虚拟表示,用于灵巧操作演示采集。接口将触觉测量渲染到机器人手网格上形成视-力反馈,并提供用户可控虚拟视角面板或遮挡感知透明渲染以缓解遮挡。通过 Task 1 与 Task 2 用户研究评估力可视化与视觉辅助在精细力控和遮挡操作任务中的作用。

  19. arXiv cs.RO 机器人学55

    用视觉预测力替代力传感器实现接触密集机器人操作

    研究提出通过柔性 Fin Ray 夹爪的形变进行视觉力预测,实现无需力或触觉传感器的力感知操作。方法先在标定数据上训练视觉力估计器为演示标注力,再训练动作-力联合生成策略,测试时选取预测力最接近目标的候选动作。在摘莓、抓空罐、手内重定向和插头插入任务上验证了可行性。