跳到正文
今天10月8日周四177 条
  1. arXiv cs.RO 机器人学51

    DexUMI 外骨骼手侧几何对触觉表征与灵巧策略性能的影响研究

    论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。

  2. arXiv cs.RO 机器人学55

    NeurIPS 2026 论文 Ariadne:仅用状态观测的流形引导轨迹规划

    论文提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练只需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,Ariadne 能从仅状态监督构建可行路径并泛化到未见过的起终点组合;在高维双臂规划上,其表现与轨迹监督方法和经典规划器相当。该论文已被 NeurIPS 2026 接收,代码已开源。

  3. arXiv cs.RO 机器人学54

    CIRRA:面向家庭机器人持续指令融合的双层框架与CHIRP基准

    论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。

  4. arXiv cs.RO 机器人学47

    基于因子图与场景图的动态环境机器人世界模型综述

    一篇 arXiv 综述系统梳理了机器人领域基于因子图与场景图的世界模型如何应对动态环境,围绕表示、构建与更新流程、下游任务利用三方面展开,并重点分析融合两类图的混合模型。综述归纳了常见架构模式,并指出从学习感知到表示层的不确定性传播、动态实体运动可观测性、可扩展的终身维护,以及缺乏数据集与评测协议等开放挑战。全文 34 页,含 7 张表、8 幅图。

  5. Hugging Face 每日论文55

    长上下文混合模型机理研究 Part 1.1:从混合注意力到混合位置

    论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。

  6. Hugging Face 每日论文49

    SGF+:解耦自回归视频生成中的梯度流

    SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。

  7. Hugging Face 每日论文57

    多向量视觉文档索引可被反演还原页面内容

    论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。

    推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。

  8. Hugging Face 每日论文64

    Long-WAM:扩展世界-动作模型上下文的模型系统框架

    Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。

    推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。

  9. IEEE Spectrum · Robotics57

    HiPHI:面向人形机器人大规模高精度人体动作与物体交互数据集白皮书

    IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。

    推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。

  10. Hugging Face 每日论文47

    AdvSim2Real:在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,抵御自适应提示注入

    AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。

10月7日周三
  1. Hugging Face 每日论文55

    DAEDALUS:从自生成任务中引导智能体记忆

    DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。

  2. Hugging Face 每日论文53

    通过推测执行隐藏端侧级联语音 Agent 的工具调用延迟

    端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。

  3. Hugging Face 每日论文55

    EmbodiedSmith:通过仿真中递归自我改进飞轮扩展具身数据

    EmbodiedSmith 提出一个通过递归自我改进(RSI)生成可扩展具身数据的框架,将资产、场景与任务生成统一到同一流水线中,支持自主创建与语言驱动定制。其核心是智能体式精修回路,场景生成预判下游任务需求,任务生成反过来引导场景编辑,使两者迭代互促,提升任务生成成功率,包括长时程任务;框架还支持移动机械臂、人形机器人与灵巧手,以及可形变物体和流体交互。

  4. Hugging Face 每日论文53

    工具使用型 Agent 如何在证据到行动的链条上失败

    研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。

  5. arXiv cs.RO 机器人学47

    Reward as Observation:仅以奖励为条件的策略实现零样本跨环境迁移

    论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。

  6. arXiv cs.RO 机器人学58

    PointZero:以 3D 点轨迹补全作为预训练目标学习可迁移的 3D 动力学

    PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。

    推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。

  7. arXiv cs.RO 机器人学45

    FedGuide:面向异构联邦强化学习的扩散先验对齐与价值基线引导

    FedGuide 提出一种异构联邦强化学习(FRL)框架,用扩散先验作为行为模型为异构本地策略学习提供个性化数据分布,并通过 Optimal-Transport Mixture-of-Experts(OT-MoE)在分布空间聚合先验,同时以 Distribution Correction Estimation(DICE)价值基线提供低方差、回报感知的策略改进引导。

  8. arXiv cs.RO 机器人学51

    Con-DSO:学习短时程一致性先验的 RGB-D 直接稀疏里程计

    Con-DSO 提出一种一致性感知的 RGB-D 直接稀疏里程计框架,通过双分支一致性网络预测像素级光度与几何不确定性,并以解耦的光度-几何加权方案融入关键帧跟踪。在五个公开 RGB-D 基准上,其绝对轨迹误差在 ICL-NUIM 上降低超过 20%,在 RGB-D Scenes V2、TUM/BONN 和 OpenLORIS 上降低约 50% 至 80%。

  9. arXiv cs.RO 机器人学55

    HARL-A:基于 IsaacLab 的异构多智能体对抗强化学习基准框架

    HARL-A 是一个基于 IsaacLab 的开源框架,支持在高保真物理仿真中对形态各异的机器人团队进行可扩展的对抗策略训练与基准评测,团队数量和每队机器人形态组合均可任意配置。该框架扩展了 HARL 算法库,贡献了模块化软件架构、Sumo/Soccer/3D Galaga 三个基准环境,以及超过十个预训练策略,已在 Hugging Face 公开发布,演示中可稳定产生对抗策略与涌现的角色分工。

  10. arXiv cs.RO 机器人学28

    KungfuAthleteBot:从视频学习高动态人形机器人动作与统一跌倒恢复

    KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。

  11. arXiv cs.RO 机器人学55

    Atomic Motion Coordinate:面向语言可控与力响应操作的坐标方法

    论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。

  12. arXiv cs.RO 机器人学44

    通过自回归扩散生成 3D 场景图中的高层概念

    一项机器人学研究提出统一的自回归扩散图生成模型,联合学习图结构与空间节点特征,从观测到的垂直平面自底向上构建任意层级深度的完整 3D 场景图(3DSG)。该方法在涵盖合成场景、真实建筑平面图与机器人传感器数据的 3DSG 数据集上,一致超越所有基于学习的基线与随机基线,并在最大层级与真实单层数据上超过可获取目标图规模的一次性模型。

  13. arXiv cs.RO 机器人学47

    VT-MUSE:面向视触觉操作的多模态统一序列表征学习框架

    VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。

  14. arXiv cs.RO 机器人学47

    接触模式即分层:离散-连续规划中的几何结构价值

    一篇 IROS 2026 Workshop Spotlight 论文提出将接触模式视为位形空间的分层(stratum),把规划建模为在分层间行走、分层内沿测地线运动的过程。在两项仿真任务(推动 T 形方块绕障、灵巧手中重定向立方体)中,该规划器无需预先给定模式、接触序列或分层,可在数秒内返回解。