跳到正文
今天10月8日周四17 条
  1. Hugging Face 每日论文56

    RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉

    RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。

    推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。

  2. 雷锋网60

    研究了1933篇 IROS 2026 论文,我们看到了机器人学的六项新变化

    文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。

    推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。

  3. arXiv cs.RO 机器人学55

    UniCross:统一的跨技能灵巧操作合成框架

    论文提出 UniCross 框架,将抓取、重定位、手内旋转和手内平移四项灵巧操作技能统一到共享的状态、动作空间与目标结构中,蒸馏出单一跨技能策略。该策略在四项技能上均表现良好,可泛化到未见物体、抗干扰,并在不切换策略的情况下串联成长程操作,还能跨不同手部形态迁移。

  4. arXiv cs.RO 机器人学45

    StableGrasp:从单张图像重建物理稳定的仿人手抓取

    StableGrasp 提出一个基于可微仿真的优化框架,从单张 RGB 图像重建物理稳定的仿人手抓取,将视觉手部姿态与决定抓取力的控制目标显式分离。该方法在可微仿真器中通过最小化抓取动能联合优化手部几何与控制,并对手部几何施加正则以保持视觉一致性与几何合理性。实验显示其重建的抓取在严格物理仿真下比其他手-控制策略稳定得多。

  5. arXiv cs.RO 机器人学53

    分解式触觉表示与控制框架实现小于 1 mm 接触定位与 35% 插孔成功率提升

    论文提出一种分解式触觉表示与控制框架,将法向力与接触斑映射为可从传感器读数恢复的有效接触响应,并把响应分解为接触几何、力分布和时变接触三部分分别编码与随机化,Tactile Gated Policy 在控制中保留这些表示且无需重训练即可覆盖所有掩码配置。

  6. arXiv cs.RO 机器人学45

    采用关节专用混合远程驱动的全驱动 4-DOF 机械手指设计

    一篇 arXiv 论文提出一种全驱动 4-DOF 机械手指,采用关节专用的混合远程驱动架构:MCP 关节由两组刚性连杆传动驱动,PIP 与 DIP 关节由闭合环路钢丝传动独立驱动并引入滚动接触关节(RCJ)。实验用 ArUco 标记跟踪测量滚珠丝杠位移,验证了远端传动的机械解耦;孤立驱动 MCP、PIP、DIP 时指尖平均峰值力分别为 21.28 N、9.22 N、5.75 N。

  7. arXiv cs.RO 机器人学51

    FACE:通过接触因素分解实现接触感知的模仿学习

    论文提出 FACE,一个接触因素分解的模仿学习框架,将任务意图与环境相关的接触因素分离。其表示在归一化的接触相对坐标中表达交互力,并通过学习的接触法线估计器与在线摩擦估计器推断局部接触法线和有效摩擦尺度,从而在执行中把力观测编码、把策略输出解码为运动与力指令,无需更新策略参数即可适配当前接触条件。

  8. arXiv cs.RO 机器人学55

    论文提出 Entity-Level Goal Readout,让机器人操作世界模型输出可执行目标

    论文提出 Entity-Level Goal Readout,把可执行的终态目标作为 3D trace 世界模型的显式输出,结合以物体为中心的位姿预测与基于观测深度的平移,生成 SE(3) 紧凑目标,再由共享的 Pose-Native Executor 结合在线物体位姿反馈进行闭环控制,无需重跑世界模型。

  9. arXiv cs.RO 机器人学47

    Co²Skill:通过技能组合实现长时程人机环境交互的全身控制

    Co²Skill 提出统一策略,将场景交互与灵巧物体操作整合到同一全身控制框架中,基于预训练运动先验并使用任务与阶段相关的观测掩码选择信息。该方法引入目标条件下的 loco-manipulation 课程与跨任务课程,联合训练单项技能和选定任务序列,在任务边界保持物理状态并维持抓取。在坐、站、爬、上下楼梯及目标导向操作等任务上完成评估,并在室内环境中演示了技能组合。

  10. arXiv cs.RO 机器人学51

    DexUMI 外骨骼手侧几何对触觉表征与灵巧策略性能的影响研究

    论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。

  11. 机器人大讲堂58

    别把自动驾驶的进度表套到具身智能上

    文章认为自动驾驶能迁移给具身智能的是约50%的技术基建和方法论,但那张时间表不该一起搬。光象科技CEO张涛指出迁移部分落在数据采集、清洗、端到端训练、仿真验证和真机测试流程上,而接触类任务是机器人独有的难点;自变量王潜认为自动驾驶难点在导航和运动,机器人难点在操作,视觉只差几像素的两瓶水在动作层面就是两件事。

    推荐理由:原文用50%迁移比例、仿真真机成功率落差和出货量对比,拆解了自动驾驶方法论能给具身智能留下什么、带不走什么。

10月7日周三
  1. arXiv cs.RO 机器人学47

    VT-MUSE:面向视触觉操作的多模态统一序列表征学习框架

    VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。

  2. arXiv cs.RO 机器人学52

    DexPIE:从真实部署经验中稳定提升灵巧操作策略

    DexPIE 在三个真实世界灵巧操作任务上将成功率较基于演示的参考策略提升 37.3%,超过所有基线方法。该后训练框架通过灵巧手适配的干预系统与多阶段 DAgger 式数据采集扩大探索覆盖,并以连续最优性指示器条件化策略,更细粒度地利用数据质量。源代码与数据集将公开发布。

  3. arXiv cs.RO 机器人学52

    Affordance2Action:面向实时操作的任务条件化场景级可供性定位基准

    Affordance2Action(A2A)提出以 A2A-Bench 为核心的场景级任务条件化可供性定位框架,覆盖日常场景中的单区域与多区域指令对应关系。其数据构建管线 A2A-AffordGen 结合语言模型过滤、交互式部件分割、实例级 mask-out 精修、任务推理指令生成与人工校验。

  4. arXiv cs.RO 机器人学58

    FingerEye:基于连续视觉触觉感知的灵巧操作学习框架

    FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。

    推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。

  5. arXiv cs.RO 机器人学55

    HRDexDB:覆盖人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 发布了一个覆盖人类与 5 种机器人本体的 4D 灵巧抓取数据集,包含 100 种物体上的 3.2K 次抓取试验。数据集通过同步多相机系统与重建管线提供多视角及第一人称 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹与成功/失败标注。基于该数据集,作者演示了人类到机器人的接触图迁移、视觉机器人-物体接触估计与检索辅助抓取三项应用。

  6. arXiv cs.RO 机器人学57

    论文提出低成本力控触觉夹爪 TF-Gripper 与力控操作框架 RETAF

    论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。

  7. arXiv cs.RO 机器人学55

    MIM-VLA:从夹爪电机反馈学习物理交互表征

    MIM-VLA 用夹爪电流、位置、速度和信号有效性编码为 128 维交互 token,预训练后仅调节 SmolVLA 的夹爪动作通路,手臂动作与位置控制接口保持不变。在三个真实场景、13 对物体的测试中,MIM-VLA 选择高阻力物体的比例为 75.0%,SmolVLA 基线为 48.8%;该方法仅使用夹爪已有电机反馈,无需额外触觉阵列、力矩传感器、标定力估计或直接电流控制。

  8. arXiv cs.RO 机器人学55

    EigenDEXplore:用人体先验结构化灵巧操作探索

    EigenDEXplore 在独立关节空间噪声上叠加沿人体数据特征向量方向的扰动,以结构化探索而非改变动作表示的方式引入相关性,在多种灵巧手上于抓取、手内重定向和接触密集操作任务中持续优于关节空间与学习动作空间基线。实验表明人体运动先验用于结构化探索时最有效,收益覆盖无结构与参考引导 RL、轨迹优化及 sim-to-real 部署,在奖励整形与课程设计较少的设置中提升最大。

  9. arXiv cs.RO 机器人学55

    TacZero:用通用视觉-语言模型与触觉反馈实现免训练的插孔操作

    TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。

  10. arXiv cs.RO 机器人学56

    ReDex:通过手指级柔顺交互修复仿真到真实的灵巧操作策略

    ReDex 提出一个框架,将仿真训练的基座策略适配到真实世界,通过纠正局部接触失败并引入触觉反馈来提升灵巧操作表现。在真实硬件上的两项接触密集任务中,相比仿真到真实迁移的基座策略,Object Flipping 成功率从 14% 提升到 86%(两个物体),Screwdriver Rotation 平均进度从 26.0% 提升到 95.3%(三个物体)。

  11. arXiv cs.RO 机器人学51

    LoopVLA:面向循环任务执行的跨子任务事件记忆接口

    LoopVLA 提出跨子任务事件记忆接口,将刚完成的子任务压缩为记忆供下一子任务的动作专家调用,以支持重复执行与停止决策。可学习事件隐变量查询已闭合片段的 token,动作特征查询历史与联合历史-事件上下文,两路读出经残差融合注入动作头。在记忆基准上,LoopVLA 配合在线子目标预测在重复任务组取得 80.22% 成功率,整体成功率优于强记忆基线。

  12. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  13. arXiv cs.RO 机器人学53

    Token-World:在视觉-语言模型 Token 空间进行世界建模以实现机器人操作

    Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。

  14. arXiv cs.RO 机器人学44

    CoBrush:面向人机协同绘画的分层规划框架

    CoBrush 提出一种分层规划框架,把多轮人机协同绘画拆解为语义、空间与执行三层协调过程,将高层意图推断与空间定位、笔触级控制分离,支持在真实丙烯画布上渐进式构建复杂场景。真实人机绘画会话、压力测试与用户研究表明,相比单轮基线,CoBrush 在语义对齐、空间推进稳定性与机器人动作合理性上更优。该工作已被 IROS 2026 接收。

  15. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。