工具使用型 Agent 如何在证据到行动的链条上失败
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
研究提出 SafeActBench,包含 6 个操作域、5 类协议下的 656 个案例,用证据溯源台账与确定性轨迹评估器追踪工具使用型 Agent 从静态动作判断到单步、多步工作流的失败点。在 10 种模型-框架配置中,静态动作评估较强与交互执行较弱并存,失败常发生在执行前:调查不完整或证据未确立就动手。证据确立后单步执行通常可靠,多步工作流则暴露未解决的前置条件与执行不完整。
Avery Flies 设计并组装了一架 27 英尺长的遥控热力飞艇,靠丙烷燃烧器加热空气产生升力。除手工缝制的尼龙气囊外,动力与控制多取自 R/C 模型:70 mm 电动涵道风扇维持气囊形状,无刷直流电机驱动 18" 螺旋桨提供推力,转向舵机则改装自 R/C 帆船绞盘舵机。
论文提出一种仅以奖励和动作为条件的 reward-based 策略,实现源环境与观测空间完全不同的目标环境之间的零样本迁移。该策略在 Pointmass、Cartpole 和 2D Car Racing 三个环境中训练,可零样本迁移到不同配色、3D 渲染或 Habitat-Sim 中 Stretch 机器人导航等全新观测,并能进一步引导目标环境中 observation-based 策略的训练。
一篇 arXiv 论文提出了一种用于 Signal Temporal Logic(STL)控制综合的几何判定方法,将时序约束转化为时间零点处的连续空间后向可达集,可行性判定与时间视界长度完全无关。
PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。
推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。
FedGuide 提出一种异构联邦强化学习(FRL)框架,用扩散先验作为行为模型为异构本地策略学习提供个性化数据分布,并通过 Optimal-Transport Mixture-of-Experts(OT-MoE)在分布空间聚合先验,同时以 Distribution Correction Estimation(DICE)价值基线提供低方差、回报感知的策略改进引导。
Con-DSO 提出一种一致性感知的 RGB-D 直接稀疏里程计框架,通过双分支一致性网络预测像素级光度与几何不确定性,并以解耦的光度-几何加权方案融入关键帧跟踪。在五个公开 RGB-D 基准上,其绝对轨迹误差在 ICL-NUIM 上降低超过 20%,在 RGB-D Scenes V2、TUM/BONN 和 OpenLORIS 上降低约 50% 至 80%。
论文提出从 DINO 残差中学习的残差潜在动作(RLA)表示,并据此构建 RLA World Model(RLA-WM),通过 flow matching 预测 RLA 值,在仿真与真实数据集上超过现有特征式与视频扩散世界模型,速度比视频扩散快若干数量级。
HARL-A 是一个基于 IsaacLab 的开源框架,支持在高保真物理仿真中对形态各异的机器人团队进行可扩展的对抗策略训练与基准评测,团队数量和每队机器人形态组合均可任意配置。该框架扩展了 HARL 算法库,贡献了模块化软件架构、Sumo/Soccer/3D Galaga 三个基准环境,以及超过十个预训练策略,已在 Hugging Face 公开发布,演示中可稳定产生对抗策略与涌现的角色分工。
KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。
研究提出 Completion Aware Guidance(CAG),一种无需训练的采样方法,将 World Action Models 的生成引导向任务完成。在 RoboTwin 2.0 子集上成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,任务未完成想象比例从 79% 降至 40%。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。
一项机器人学研究提出统一的自回归扩散图生成模型,联合学习图结构与空间节点特征,从观测到的垂直平面自底向上构建任意层级深度的完整 3D 场景图(3DSG)。该方法在涵盖合成场景、真实建筑平面图与机器人传感器数据的 3DSG 数据集上,一致超越所有基于学习的基线与随机基线,并在最大层级与真实单层数据上超过可获取目标图规模的一次性模型。
论文提出 VLAct,一种面向 Vision-Language-Action 模型的 VLM 骨干,在任务微调前于多本体机器人数据上继续预训练,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨本体动作布局来保留通用视觉先验并共享动作语义。
VT-MUSE 提出两阶段多模态统一序列表征学习框架,用于视触觉操作任务,通过跨模态时序对齐与掩码视图一致性联合适配模态编码器,并以条件变分潜变量模型处理掩码视觉序列与完整触觉历史。该表征经门控交叉注意力接入轻量 Transformer 策略,在仿真基准上较最强基线在全部任务上高出 11 个百分点,真实实验也取得显著提升。
PhysCaP 提出一种面向机器人操作主动感知的 Physics-Informed Code-as-Policy 智能体系统,通过免训练的物理属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,无需额外传感器。
一篇 IROS 2026 Workshop Spotlight 论文提出将接触模式视为位形空间的分层(stratum),把规划建模为在分层间行走、分层内沿测地线运动的过程。在两项仿真任务(推动 T 形方块绕障、灵巧手中重定向立方体)中,该规划器无需预先给定模式、接触序列或分层,可在数秒内返回解。
论文提出 Model-Based Diffusion Optimal Control(MDOC),一种基于模型的扩散规划器,无需依赖演示数据即可高效生成动力学可行轨迹。
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。
该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。
推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。
论文提出支持集条件化的控制敏感性正则化(support-conditioned control-sensitivity regularization),在训练数据支撑良好的区域提升动力学模型对控制输入的局部响应性,从而保留控制引起的潜在变化。
DexPIE 在三个真实世界灵巧操作任务上将成功率较基于演示的参考策略提升 37.3%,超过所有基线方法。该后训练框架通过灵巧手适配的干预系统与多阶段 DAgger 式数据采集扩大探索覆盖,并以连续最优性指示器条件化策略,更细粒度地利用数据质量。源代码与数据集将公开发布。
Affordance2Action(A2A)提出以 A2A-Bench 为核心的场景级任务条件化可供性定位框架,覆盖日常场景中的单区域与多区域指令对应关系。其数据构建管线 A2A-AffordGen 结合语言模型过滤、交互式部件分割、实例级 mask-out 精修、任务推理指令生成与人工校验。
GeoAlign 提出一种状态引导的空间对齐架构用于 VLA 策略学习,通过离线 RGB-D 监督后训练几何分支生成 GEP 特征,再丢弃深度头,仅用 RGB、语言与本体感知状态完成策略训练与执行。
论文提出双向增量广义混合 A*(Bi-IGHA*)算法,通过让对向搜索在低分辨率下绕过被冻结顶点,缓解 IGHA* 的冻结顶点障碍。在 R3、R4、R6 的开环实验中,Bi-IGHA* 相比 IGHA* 显著减少搜索扩展次数,闭环实验在仿真与真实机器人系统上验证了性能与可行性提升。
论文提出跨空间对称性组合框架,让机器人策略同时对构型空间与任务空间的多个对称性保持等变,借助正运动学映射的微分几何结构实现对称性在两个空间间的下降与提升。在双臂机器人的仿真与真实实验中验证,联合利用多个对称性带来更好的泛化能力,视频与源码已公开。
FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。
推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。
HRDexDB 发布了一个覆盖人类与 5 种机器人本体的 4D 灵巧抓取数据集,包含 100 种物体上的 3.2K 次抓取试验。数据集通过同步多相机系统与重建管线提供多视角及第一人称 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹与成功/失败标注。基于该数据集,作者演示了人类到机器人的接触图迁移、视觉机器人-物体接触估计与检索辅助抓取三项应用。
ReBound 提出一种面向免重置强化学习的价值学习方法,将导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并从恢复后价值按实际恢复时间折扣进行自举,同时用奖励中心化稳定价值学习。在仿真和 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文共 9 页、6 幅图,以 arXiv:2604.07672 提交。
BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。
论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。
GenZ-LIO 提出一种可泛化的 LiDAR-Inertial 里程计(LIO)框架,通过尺度自适应体素化、混合度量状态更新与体素剪枝对应搜索,适应受限与开放空间之间的尺度变化。
PC-Diffuser 将可认证、路径一致的屏障函数结构嵌入扩散规划的去噪循环,实现轨迹生成过程中的迭代安全防护。该框架用 capsule-distance 屏障函数评估碰撞风险以更好反映车辆几何并降低不必要保守性,在 kinematic bicycle 模型下将去噪路点转换为动力学可行运动,并通过路径一致安全滤波消除残余约束违规而不产生几何畸变,使修正后的计划保持接近学习分布。
TransMASK 提出一种自监督方法,学习一个掩码与观测图像特征相乘,仅保留与任务相关的特征,可与 diffusion policies 等模仿学习框架结合,无需额外标签或修改损失函数。实验表明该掩码具有可解释性,能拒绝干扰物位置、背景颜色等虚假特征,在分布外环境测试中相比基线方法至少提升 30% 的鲁棒性。项目网站已公开。
SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,在仿真中程序化生成大量工具类物体原语并训练单一策略,实现测试时无需针对具体物体或任务的训练即可完成灵巧工具操作。
论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。
GaussianCaR 提出一种端到端 BEV 分割网络,将 Gaussian Splatting 用作通用视角变换器,把图像像素与雷达点映射到统一的 Bird's-Eye View 表示,实现相机-雷达融合。
针对软体膝关节康复外骨骼难以精确建模气动执行器与人机耦合动力学的问题,研究提出基于 Koopman 的模型预测控制(KMPC)框架,用提升线性 Koopman 模型表示非线性人机耦合系统,并将肌电(EMG)信号纳入系统输入以捕捉个体神经肌肉特征。
论文提出自监督框架 LfH-CP,通过两阶段幻觉关键点生成动态障碍物数据集,无需专家演示或试错探索。该方法先识别障碍物必须出现的时空关键点以形成近最优运动规划,再程序化生成多样轨迹,避免模式坍缩。仿真中基于 LfH-CP 数据集训练的规划器成功率高于既有幻觉方法。