跳到正文
  1. 雷锋网60

    研究了1933篇 IROS 2026 论文,我们看到了机器人学的六项新变化

    文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。

    推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。

  2. Hugging Face 每日论文56

    RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉

    RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。

    推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。

  1. arXiv cs.RO 机器人学58

    FingerEye:基于连续视觉触觉感知的灵巧操作学习框架

    FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。

    推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。

  2. arXiv cs.RO 机器人学58

    SimToolReal:面向零样本灵巧工具操作的以物体为中心策略

    SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,在仿真中程序化生成大量工具类物体原语并训练单一策略,实现测试时无需针对具体物体或任务的训练即可完成灵巧工具操作。

  3. arXiv cs.RO 机器人学58

    FlashDexRetarget 提出多参考强化学习框架,加速灵巧操作数据生成

    FlashDexRetarget 提出一种基于强化学习的多参考灵巧重定向框架,用单一策略联合学习多条演示,将重定向优化成本分摊到各参考上。

    推荐理由:论文给出与 CHORD 的对比数据,可帮助评估多参考重定向在数据生成成本上的实际收益。

  4. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  5. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。

  6. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。

  7. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  8. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  9. arXiv cs.RO 机器人学58

    Mulligan 提出面向机器人在机学习的性能引导数据采集方法

    Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。

    推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。

  10. arXiv cs.RO 机器人学58

    VICON:面向操作数据集的视觉-惯性-接触手物跟踪框架

    VICON 提出视觉-惯性-接触手物跟踪框架,通过改造视觉惯性手套并按人类抓握频率布置 FSR 力敏电阻,同步记录接触状态与标定法向力,配合 RGB-D 相机与单目视频重建网格、基于因子图的物体轨迹估计,在严重遮挡下联合捕捉手物运动与接触信息。

  1. Hugging Face 每日论文60

    PhysEvo:围绕冻结模型的物理递归自改进框架在 RoboDojo 与真机上评测

    PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。

    推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。

  1. Sanctuary AI 新闻63

    Sanctuary AI 提出 TIGER,用模仿策略作稠密奖励引导真机强化学习

    Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。

    推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。

  1. 逐际动力官网新闻57

    逐际动力联合南方科技大学CLEAR Lab、香港大学论文入选CoRL 2025,提出GVF-TAPE让机器人看视频学会操作

    南方科技大学CLEAR Lab联合逐际动力、香港大学的论文《Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-top Manipulation》入选CoRL 2025,提出GVF-TAPE算法,让机器人通过观看操作视频预测任务执行过程并学会自主操作。

    推荐理由:论文给出LIBERO基准成功率与实机任务结果,可看出纯RGB视频驱动操作训练相比依赖深度相机和动作标注方法的差距。

已经到底了