跳到正文
10月7日周三
  1. Hugging Face 每日论文53

    工具使用型 Agent 如何在证据到行动的链条上失败

    研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。

  2. Hackaday46

    27英尺遥控热力飞艇:丙烷燃烧是设计使然

    Avery Flies 设计并组装了一架 27 英尺长的遥控热力飞艇,靠丙烷燃烧器加热空气产生升力。除手工缝制的尼龙气囊外,动力与控制多取自 R/C 模型:70 mm 电动涵道风扇维持气囊形状,无刷直流电机驱动 18" 螺旋桨提供推力,转向舵机则改装自 R/C 帆船绞盘舵机。

  3. arXiv cs.RO 机器人学47

    Reward as Observation:仅以奖励为条件的策略实现零样本跨环境迁移

    论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。

  4. arXiv cs.RO 机器人学58

    PointZero:以 3D 点轨迹补全作为预训练目标学习可迁移的 3D 动力学

    PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。

    推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。

  5. arXiv cs.RO 机器人学45

    FedGuide:面向异构联邦强化学习的扩散先验对齐与价值基线引导

    FedGuide 提出一种异构联邦强化学习(FRL)框架,用扩散先验作为行为模型为异构本地策略学习提供个性化数据分布,并通过 Optimal-Transport Mixture-of-Experts(OT-MoE)在分布空间聚合先验,同时以 Distribution Correction Estimation(DICE)价值基线提供低方差、回报感知的策略改进引导。

  6. arXiv cs.RO 机器人学51

    Con-DSO:学习短时程一致性先验的 RGB-D 直接稀疏里程计

    Con-DSO 提出一种一致性感知的 RGB-D 直接稀疏里程计框架,通过双分支一致性网络预测像素级光度与几何不确定性,并以解耦的光度-几何加权方案融入关键帧跟踪。在五个公开 RGB-D 基准上,其绝对轨迹误差在 ICL-NUIM 上降低超过 20%,在 RGB-D Scenes V2、TUM/BONN 和 OpenLORIS 上降低约 50% 至 80%。

  7. arXiv cs.RO 机器人学55

    HARL-A:基于 IsaacLab 的异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 的开源框架,支持在高保真物理仿真中对形态各异的机器人团队进行可扩展的对抗策略训练与基准评测,团队数量和每队机器人形态组合均可任意配置。该框架扩展了 HARL 算法库,贡献了模块化软件架构、Sumo/Soccer/3D Galaga 三个基准环境,以及超过十个预训练策略,已在 Hugging Face 公开发布,演示中可稳定产生对抗策略与涌现的角色分工。

  8. arXiv cs.RO 机器人学28

    KungfuAthleteBot:从视频学习高动态人形机器人动作与统一跌倒恢复

    KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。

  9. arXiv cs.RO 机器人学55

    Atomic Motion Coordinate:面向语言可控与力响应操作的坐标方法

    论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。

  10. arXiv cs.RO 机器人学44

    通过自回归扩散生成 3D 场景图中的高层概念

    一项机器人学研究提出统一的自回归扩散图生成模型,联合学习图结构与空间节点特征,从观测到的垂直平面自底向上构建任意层级深度的完整 3D 场景图(3DSG)。该方法在涵盖合成场景、真实建筑平面图与机器人传感器数据的 3DSG 数据集上,一致超越所有基于学习的基线与随机基线,并在最大层级与真实单层数据上超过可获取目标图规模的一次性模型。

  11. arXiv cs.RO 机器人学47

    VT-MUSE:面向视触觉操作的多模态统一序列表征学习框架

    VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。

  12. arXiv cs.RO 机器人学47

    接触模式即分层:离散-连续规划中的几何结构价值

    一篇 IROS 2026 Workshop Spotlight 论文提出将接触模式视为位形空间的分层(stratum),把规划建模为在分层间行走、分层内沿测地线运动的过程。在两项仿真任务(推动 T 形方块绕障、灵巧手中重定向立方体)中,该规划器无需预先给定模式、接触序列或分层,可在数秒内返回解。

  13. arXiv cs.RO 机器人学58

    研究解析行为提示在机器人操作任务中的生效条件

    该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。

    推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。

  14. arXiv cs.RO 机器人学52

    DexPIE:从真实部署经验中稳定提升灵巧操作策略

    DexPIE 在三个真实世界灵巧操作任务上将成功率较基于演示的参考策略提升 37.3%,超过所有基线方法。该后训练框架通过灵巧手适配的干预系统与多阶段 DAgger 式数据采集扩大探索覆盖,并以连续最优性指示器条件化策略,更细粒度地利用数据质量。源代码与数据集将公开发布。

  15. arXiv cs.RO 机器人学52

    Affordance2Action:面向实时操作的任务条件化场景级可供性定位基准

    Affordance2Action(A2A)提出以 A2A-Bench 为核心的场景级任务条件化可供性定位框架,覆盖日常场景中的单区域与多区域指令对应关系。其数据构建管线 A2A-AffordGen 结合语言模型过滤、交互式部件分割、实例级 mask-out 精修、任务推理指令生成与人工校验。

  16. arXiv cs.RO 机器人学49

    双向增量广义混合 A*(Bi-IGHA*)算法论文

    论文提出双向增量广义混合 A*(Bi-IGHA*)算法,通过让对向搜索在低分辨率下绕过被冻结顶点,缓解 IGHA* 的冻结顶点障碍。在 R3、R4、R6 的开环实验中,Bi-IGHA* 相比 IGHA* 显著减少搜索扩展次数,闭环实验在仿真与真实机器人系统上验证了性能与可行性提升。

  17. arXiv cs.RO 机器人学50

    跨空间对称性组合:机器人策略在构型空间与任务空间上的联合等变学习

    论文提出跨空间对称性组合框架,让机器人策略同时对构型空间与任务空间的多个对称性保持等变,借助正运动学映射的微分几何结构实现对称性在两个空间间的下降与提升。在双臂机器人的仿真与真实实验中验证,联合利用多个对称性带来更好的泛化能力,视频与源码已公开。

  18. arXiv cs.RO 机器人学58

    FingerEye:基于连续视觉触觉感知的灵巧操作学习框架

    FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。

    推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。

  19. arXiv cs.RO 机器人学55

    HRDexDB:覆盖人类与多种机器人本体的 4D 灵巧抓取数据集

    HRDexDB 发布了一个覆盖人类与 5 种机器人本体的 4D 灵巧抓取数据集,包含 100 种物体上的 3.2K 次抓取试验。数据集通过同步多相机系统与重建管线提供多视角及第一人称 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹与成功/失败标注。基于该数据集,作者演示了人类到机器人的接触图迁移、视觉机器人-物体接触估计与检索辅助抓取三项应用。

  20. arXiv cs.RO 机器人学54

    ReBound:基于重置感知半马尔可夫自举的免重置强化学习敏捷驾驶方法

    ReBound 提出一种面向免重置强化学习的价值学习方法,将导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并从恢复后价值按实际恢复时间折扣进行自举,同时用奖励中心化稳定价值学习。在仿真和 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文共 9 页、6 幅图,以 arXiv:2604.07672 提交。

  21. arXiv cs.RO 机器人学55

    BAT:通过在线策略切换实现人形机器人长时程全身控制的敏捷与稳定平衡

    BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。

  22. arXiv cs.RO 机器人学55

    VLLR:面向长时程机器人任务的可泛化稠密奖励框架(IROS 2026)

    论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。

  23. arXiv cs.RO 机器人学47

    PC-Diffuser:面向扩散轨迹规划器的路径一致 Capsule CBF 安全滤波框架

    PC-Diffuser 将可认证、路径一致的屏障函数结构嵌入扩散规划的去噪循环,实现轨迹生成过程中的迭代安全防护。该框架用 capsule-distance 屏障函数评估碰撞风险以更好反映车辆几何并降低不必要保守性,在 kinematic bicycle 模型下将去噪路点转换为动力学可行运动,并通过路径一致安全滤波消除残余约束违规而不产生几何畸变,使修正后的计划保持接近学习分布。

  24. arXiv cs.RO 机器人学51

    TransMASK:通过学习变换实现掩码状态表示

    TransMASK 提出一种自监督方法,学习一个掩码与观测图像特征相乘,仅保留与任务相关的特征,可与 diffusion policies 等模仿学习框架结合,无需额外标签或修改损失函数。实验表明该掩码具有可解释性,能拒绝干扰物位置、背景颜色等虚假特征,在分布外环境测试中相比基线方法至少提升 30% 的鲁棒性。项目网站已公开。

  25. arXiv cs.RO 机器人学57

    论文提出低成本力控触觉夹爪 TF-Gripper 与力控操作框架 RETAF

    论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。

  26. arXiv cs.RO 机器人学44

    LfH-CP:通过幻觉关键点学习动态环境导航

    论文提出自监督框架 LfH-CP,通过两阶段幻觉关键点生成动态障碍物数据集,无需专家演示或试错探索。该方法先识别障碍物必须出现的时空关键点以形成近最优运动规划,再程序化生成多样轨迹,避免模式坍缩。仿真中基于 LfH-CP 数据集训练的规划器成功率高于既有幻觉方法。