DexUMI 外骨骼手侧几何对触觉表征与灵巧策略性能的影响研究
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
论文提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练只需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,Ariadne 能从仅状态监督构建可行路径并泛化到未见过的起终点组合;在高维双臂规划上,其表现与轨迹监督方法和经典规划器相当。该论文已被 NeurIPS 2026 接收,代码已开源。
论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。
研究团队提出首个在开放、无约束表面上实现闭环自主液滴导航的机器人平台,采用模型强化学习,仅用 50 至 150 次物理实验(视几何复杂度而定)训练策略,无需仿真或解析模型。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 改造为面向四足机器人城市导航的目标条件版本,通过 goal token 注入局部坐标系子目标并重定义人行道导向的可行驶区域合规性。
论文提出一种基于 Vision-Language Models 的上下文感知自适应喷药框架,让机器人结合作物类型、农药类型和天气数据进行空间推理与喷洒决策,并用基于 Model Predictive Path Integral 控制的轨迹跟踪控制器保证导航与喷洒精度。
SAFE 是一种低成本通用传感方案,用两个无源 PVDF 声学传感器加电机本体感知,在不依赖视觉和先验材料知识的情况下实时检测抓取中的滑移与断裂。
一篇 arXiv 综述系统梳理了机器人领域基于因子图与场景图的世界模型如何应对动态环境,围绕表示、构建与更新流程、下游任务利用三方面展开,并重点分析融合两类图的混合模型。综述归纳了常见架构模式,并指出从学习感知到表示层的不确定性传播、动态实体运动可观测性、可扩展的终身维护,以及缺乏数据集与评测协议等开放挑战。全文 34 页,含 7 张表、8 幅图。
WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名,评测基于 WebRetriever 基准的 Protocol III,要求智能体从入口 URL 出发操作真实网站并返回可验证答案。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。
推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。
论文提出CheckerBench,一个包含300个任务的可执行基准,任务源自167个仓库中的297个CVE,覆盖85种CWE和5种语言生态,每个任务提供存在漏洞与修复后的版本、固定的分析环境和检查器脚手架。
AdvSim2Real 在冻结的 Web 世界模型中协同进化任务课程、注入对抗样本与 Web Agent,使 4B agent 在有无攻击时完成率均提升,且能力增益可迁移到真实浏览器。在 150 个 Web 任务上,面对未训练过的前沿模型对抗者,AdvSim2Real 将完成率相对基础 agent 提升 33.6%。
DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。
端侧级联语音 Agent 采用推测工具执行方案,通过 Predictor 模块在 ASR 阶段预测工具调用并提前执行、缓存结果注入 LLM prompt,实测 Android 语音助手的中位首音频时间从 5.79s 降至 4.60s,标准差从 3.49s 降至 2.81s。方案用基于规则的校验机制过滤用户自我纠正导致的错误缓存,LLM 仍可直接发起工具调用,最坏情况延迟不高于基线串行流水线。
EmbodiedSmith 提出一个通过递归自我改进(RSI)生成可扩展具身数据的框架,将资产、场景与任务生成统一到同一流水线中,支持自主创建与语言驱动定制。其核心是智能体式精修回路,场景生成预判下游任务需求,任务生成反过来引导场景编辑,使两者迭代互促,提升任务生成成功率,包括长时程任务;框架还支持移动机械臂、人形机器人与灵巧手,以及可形变物体和流体交互。
跨 Tokenizer On-Policy 蒸馏研究发现,严格 1:1 对齐位置已覆盖学生生成的大部分 token,将 reverse KL 限制在每个严格位置的共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率。
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。
一篇 arXiv 论文提出了一种用于 Signal Temporal Logic(STL)控制综合的几何判定方法,将时序约束转化为时间零点处的连续空间后向可达集,可行性判定与时间视界长度完全无关。
PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。
推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。
FedGuide 提出一种异构联邦强化学习(FRL)框架,用扩散先验作为行为模型为异构本地策略学习提供个性化数据分布,并通过 Optimal-Transport Mixture-of-Experts(OT-MoE)在分布空间聚合先验,同时以 Distribution Correction Estimation(DICE)价值基线提供低方差、回报感知的策略改进引导。
Con-DSO 提出一种一致性感知的 RGB-D 直接稀疏里程计框架,通过双分支一致性网络预测像素级光度与几何不确定性,并以解耦的光度-几何加权方案融入关键帧跟踪。在五个公开 RGB-D 基准上,其绝对轨迹误差在 ICL-NUIM 上降低超过 20%,在 RGB-D Scenes V2、TUM/BONN 和 OpenLORIS 上降低约 50% 至 80%。
论文提出从 DINO 残差中学习的残差潜在动作(RLA)表示,并据此构建 RLA World Model(RLA-WM),通过 flow matching 预测 RLA 值,在仿真与真实数据集上超过现有特征式与视频扩散世界模型,速度比视频扩散快若干数量级。
HARL-A 是一个基于 IsaacLab 的开源框架,支持在高保真物理仿真中对形态各异的机器人团队进行可扩展的对抗策略训练与基准评测,团队数量和每队机器人形态组合均可任意配置。该框架扩展了 HARL 算法库,贡献了模块化软件架构、Sumo/Soccer/3D Galaga 三个基准环境,以及超过十个预训练策略,已在 Hugging Face 公开发布,演示中可稳定产生对抗策略与涌现的角色分工。
KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。
研究提出 Completion Aware Guidance(CAG),一种无需训练的采样方法,将 World Action Models 的生成引导向任务完成。在 RoboTwin 2.0 子集上成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,任务未完成想象比例从 79% 降至 40%。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。
一项机器人学研究提出统一的自回归扩散图生成模型,联合学习图结构与空间节点特征,从观测到的垂直平面自底向上构建任意层级深度的完整 3D 场景图(3DSG)。该方法在涵盖合成场景、真实建筑平面图与机器人传感器数据的 3DSG 数据集上,一致超越所有基于学习的基线与随机基线,并在最大层级与真实单层数据上超过可获取目标图规模的一次性模型。
论文提出 VLAct,一种面向 Vision-Language-Action 模型的 VLM 骨干,在任务微调前于多本体机器人数据上继续预训练,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨本体动作布局来保留通用视觉先验并共享动作语义。
VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。
PhysCaP 提出一种面向机器人操作主动感知的 Physics-Informed Code-as-Policy 智能体系统,通过免训练的物理属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,无需额外传感器。
一篇 IROS 2026 Workshop Spotlight 论文提出将接触模式视为位形空间的分层(stratum),把规划建模为在分层间行走、分层内沿测地线运动的过程。在两项仿真任务(推动 T 形方块绕障、灵巧手中重定向立方体)中,该规划器无需预先给定模式、接触序列或分层,可在数秒内返回解。
论文提出 Model-Based Diffusion Optimal Control(MDOC),一种基于模型的扩散规划器,无需依赖演示数据即可高效生成动力学可行轨迹。
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。