Guided Action Flow:面向冻结 VLA 策略的价值引导采样方法
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。
该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。
推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。
论文提出支持集条件化的控制敏感性正则化(support-conditioned control-sensitivity regularization),在训练数据支撑良好的区域提升动力学模型对控制输入的局部响应性,从而保留控制引起的潜在变化。
DexPIE 在三个真实世界灵巧操作任务上将成功率较基于演示的参考策略提升 37.3%,超过所有基线方法。该后训练框架通过灵巧手适配的干预系统与多阶段 DAgger 式数据采集扩大探索覆盖,并以连续最优性指示器条件化策略,更细粒度地利用数据质量。源代码与数据集将公开发布。
Affordance2Action(A2A)提出以 A2A-Bench 为核心的场景级任务条件化可供性定位框架,覆盖日常场景中的单区域与多区域指令对应关系。其数据构建管线 A2A-AffordGen 结合语言模型过滤、交互式部件分割、实例级 mask-out 精修、任务推理指令生成与人工校验。
GeoAlign 提出一种状态引导的空间对齐架构用于 VLA 策略学习,通过离线 RGB-D 监督后训练几何分支生成 GEP 特征,再丢弃深度头,仅用 RGB、语言与本体感知状态完成策略训练与执行。
论文提出双向增量广义混合 A*(Bi-IGHA*)算法,通过让对向搜索在低分辨率下绕过被冻结顶点,缓解 IGHA* 的冻结顶点障碍。在 R3、R4、R6 的开环实验中,Bi-IGHA* 相比 IGHA* 显著减少搜索扩展次数,闭环实验在仿真与真实机器人系统上验证了性能与可行性提升。
论文提出跨空间对称性组合框架,让机器人策略同时对构型空间与任务空间的多个对称性保持等变,借助正运动学映射的微分几何结构实现对称性在两个空间间的下降与提升。在双臂机器人的仿真与真实实验中验证,联合利用多个对称性带来更好的泛化能力,视频与源码已公开。
FingerEye 是一个传感与学习框架,通过贯穿交互全程的视觉触觉反馈提升机器人灵巧操作能力。传感侧将双目 RGB 相机与柔性接触界面结合,接触前用指尖相机提供近距视觉线索与隐式立体信息,接触后用标记点追踪柔性环形件形变作为接触力旋量感知的代理;学习侧构建了真机与仿真数据基础设施,并提出 FingerEye Policy,采用分组结构的模态融合以减少模态捷径。
推荐理由:论文给出视觉触觉融合的具体设计与七项任务上的量化提升,可作为多模态灵巧操作方案的参考。
HRDexDB 发布了一个覆盖人类与 5 种机器人本体的 4D 灵巧抓取数据集,包含 100 种物体上的 3.2K 次抓取试验。数据集通过同步多相机系统与重建管线提供多视角及第一人称 RGB 观测、3D 手部几何、机器人状态、物体 6D 位姿轨迹与成功/失败标注。基于该数据集,作者演示了人类到机器人的接触图迁移、视觉机器人-物体接触估计与检索辅助抓取三项应用。
ReBound 提出一种面向免重置强化学习的价值学习方法,将导致碰撞的动作与后续恢复过程合并为单个半马尔可夫转移,并从恢复后价值按实际恢复时间折扣进行自举,同时用奖励中心化稳定价值学习。在仿真和 1/10 比例实车上,ReBound 显著优于常规价值学习方法与基于模型的控制。论文共 9 页、6 幅图,以 arXiv:2604.07672 提交。
BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。
论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。
GenZ-LIO 提出一种可泛化的 LiDAR-Inertial 里程计(LIO)框架,通过尺度自适应体素化、混合度量状态更新与体素剪枝对应搜索,适应受限与开放空间之间的尺度变化。
PC-Diffuser 将可认证、路径一致的屏障函数结构嵌入扩散规划的去噪循环,实现轨迹生成过程中的迭代安全防护。该框架用 capsule-distance 屏障函数评估碰撞风险以更好反映车辆几何并降低不必要保守性,在 kinematic bicycle 模型下将去噪路点转换为动力学可行运动,并通过路径一致安全滤波消除残余约束违规而不产生几何畸变,使修正后的计划保持接近学习分布。
TransMASK 提出一种自监督方法,学习一个掩码与观测图像特征相乘,仅保留与任务相关的特征,可与 diffusion policies 等模仿学习框架结合,无需额外标签或修改损失函数。实验表明该掩码具有可解释性,能拒绝干扰物位置、背景颜色等虚假特征,在分布外环境测试中相比基线方法至少提升 30% 的鲁棒性。项目网站已公开。
SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,在仿真中程序化生成大量工具类物体原语并训练单一策略,实现测试时无需针对具体物体或任务的训练即可完成灵巧工具操作。
论文提出低成本力控平行夹爪 TF-Gripper,售价约$150,有效力控范围0.45-45 N,兼容不同机械臂,并配套遥操作设备记录人手抓取力。作者进一步提出 RETAF 框架,将抓取力控制与臂部位姿预测解耦,用腕部图像和触觉反馈高频调节力,实验显示在六项真实任务中直接力控相比位置控制提升抓取稳定性与整体表现,触觉反馈对力控调节必不可少,RETAF 优于基线且可与多种基础策略集成。
GaussianCaR 提出一种端到端 BEV 分割网络,将 Gaussian Splatting 用作通用视角变换器,把图像像素与雷达点映射到统一的 Bird's-Eye View 表示,实现相机-雷达融合。
针对软体膝关节康复外骨骼难以精确建模气动执行器与人机耦合动力学的问题,研究提出基于 Koopman 的模型预测控制(KMPC)框架,用提升线性 Koopman 模型表示非线性人机耦合系统,并将肌电(EMG)信号纳入系统输入以捕捉个体神经肌肉特征。
论文提出自监督框架 LfH-CP,通过两阶段幻觉关键点生成动态障碍物数据集,无需专家演示或试错探索。该方法先识别障碍物必须出现的时空关键点以形成近最优运动规划,再程序化生成多样轨迹,避免模式坍缩。仿真中基于 LfH-CP 数据集训练的规划器成功率高于既有幻觉方法。
一种将物体重建信息以可见性约束融入移动机械臂全身控制的方法,无需额外路径规划器即可在路径上保持信息量最大区域处于相机视野内。在 114 个物体、57 个类别的仿真与 8 DoF 全向移动机械臂、腿式机械臂实机实验中,该方法重建熵与采样策略无统计显著差异,计算时间快 6.2 至 19.36 倍,视点间总耗时减少 13.76% 至 27.9%。
LHM-Humanoid 通过学习"可恢复"的周期交接状态,让物理仿真人形在单次不间断运行中反复完成取物—搬运—放置,在 350 个覆盖四类房间的杂乱布局上取得比端到端 RL、分层 RL 及既有物理人机交互方法更成功、更稳定的长时程运动表现。
一套三阶段离线指令生成框架在悬挂式双足机器人上复现了 Vicon 系统记录的人体行走与下蹲动作,关节角度重复试验的平均 RMSE 低于 7°、标准差低于 0.33°。框架先用 SDRE 控制推导参考力矩轨迹,再经参数化优化转为受电机转速与加速度限制的梯形关节速度指令,最后由 PID-LQR 补偿修正。各报告情形下关节角度与力矩轨迹的最大 RMSE 和标准差均低于 MPC 与 IPSO-PID。
一套 11-DOF 机器人系统将 6-DOF 机械臂与改进的 5-DOF 绳驱末端执行器结合,用于 CT 引导针刺活检,通过加权逆运动学控制器与零空间控制策略提升灵巧度与工作空间。在临床相关仿真场景中,该系统在不同人体模型上达到 97% 的一致可达率。面向任务的加权矩阵策略在穿刺活检的五个代表性子任务中经仿真与真实实验验证,表现出更优的跟踪精度与可操作性。
一项硬件在环 V2I 研究将任务感知证明建模为运行时保障契约,把完整性有效、证据足够新鲜、决策在预算内完成三个条件绑定,把二值门控的两种结果扩展为四种,区分篡改、证据过期与决策超时导致的拒绝。
VeriFine 提出一种 agent harness 框架,通过策略、训练课程与 judge 的协同演化来扩展验证能力,以支撑具身推理中的持续自我改进。
ACM MobiHoc 2026 接收的 Demo 论文展示了一个通过 ROS 2 耦合 NVIDIA Isaac Sim 与 NVIDIA Sionna 的实时协同仿真框架,闭合感知-动作-通信(PAC)环路。
一项研究提出将人群规模的不良事件监测作为手术数字孪生的独立信念层,并在 FDA MAUDE 血栓取回导管(产品代码 NRY)的 8,617 份报告上评测联邦贝叶斯协议,其中 6,491 份按关键词规则分为五类并划分到 K=8 个厂商站点。
研究提出上下文条件化的 Hamilton-Jacobi 可达性方法,为八状态车辆模型学习一个后向可达管,以局部边界几何、摩擦系数和对抗扰动尺度为条件,无需重新综合即可跨部署条件查询。
EmbodiedSmith 提出一个通过递归自我改进(RSI)规模化生成具身数据的框架,将资产、场景与任务生成统一到同一流水线,支持自主创建和语言驱动定制。其核心是智能体式改进回路,场景生成预判下游任务需求,任务生成引导场景定向编辑,使场景与任务迭代互相改进,提升任务生成成功率,包括长时程任务。
arXiv 论文提出 CATS(Conditioning for Action using only Temporal Smoothness),通过证明时序惩罚可约束共享下一状态的当前状态间期望动作差异,为时序正则化提供了空间平滑效果。CATS 将时序惩罚与线性 ramp-up 结合,先学习高回报行为再逐步平滑动作,在仿真与真实机器人实验中显著减少动作振荡,且几乎不增加计算开销、不损害任务性能。
一篇 arXiv 论文提出信念引导的双控制算法,将信念空间滚动时域选择与目标集进展函数的期望下降约束结合,证明了决策时刻几乎必然的目标集收敛。在平面调节实验中,两步前瞻选择在 11 次决策内将欧氏状态范数降至 0.01 以下,而短视的单步选择在零输入后立即失去可容许性。在模拟双臂装配任务中,该算法相对参考跟踪基线将无穷范数相对位置误差降低 96.4%。
JEPA 世界模型训练中加入动作重建(逆动力学损失)目标,可保证编码器在有限时域可达子空间上为单射,从而保留对控制至关重要的不稳定模态。论文证明精确动作重建使编码器不丢弃任何 H 步内可达的状态方向,且有限时域可控性 Gramian 的主特征空间随 H 增大收敛到可控不稳定子空间。
MRPilot 是一个混合现实系统,围绕 Forming、Reviewing、Following、Repairing 四个阶段监督和干预基于 LLM 的多机器人团队,将机器人团队计划与执行状态表示为跨同步就地视图和总览视图共享的结构化承诺。
一项研究将视觉语言导航(VLN)从仿真环境迁移到真实世界,在自建的 Ackermann 转向移动机器人上实现离线导航。该系统采用 Cross-Modal Attention(CMA)架构,通过线性光度调整和少量真实数据微调完成域适应,无需导航图或全景视图。实验以 SPL 和 nDTW 指标评估,验证了方法的鲁棒性与适应性。
R2RI 是首个专为机器人间交互(RRI)任务设计的数据集,包含多款人形机器人基于真实人类社交行为建模的交互场景,提供各机器人机载传感器的第一人称视角与外部固定相机的第三视角。数据集涵盖 Event 与 RGB 两种模态,规模超过 6.5M 帧、约 5000 段视频,帧率达 120 fps,已公开发布全部任务与模态的数据及标注,并对比了两种模态在多项感知与交互任务上的表现。
一项面向工程硕士生的可扩展游戏化工作坊在 10 场次中让 226 名学生通过移动网页界面为非推理与推理 LLM 编写提示词,完成复杂度递增的网格导航任务,系统返回机器人可执行计划、轨迹可视化与自动评分,并在 Boston Dynamics Spot 机器人上进行现场演示。
Hierarchy-GBP(H-GBP)提出两阶段迭代框架,先用粗图近似(abstraction)求解全局误差并投影回原图(recovery),再用 GBP 精修局部误差,通过推导抽象与恢复步骤的组合矩阵算子并分析其谱半径,证明了收敛到最优解。
一项针对四旋翼强化学习控制器的研究比较了5种扰动保真度等级(从无风、离散1-cosine阵风到统计湍流、合成相干结构和大涡模拟大气边界层场),在0-12 m/s风速扫描下对PPO智能体进行全交叉保真度训练测试评估。