Agentic Scene Policies:面向零样本泛化的机器人策略框架被 IROS 2026 接收
论文提出机器人策略框架 Agentic Scene Policies(ASP),通过 scene-agent 工具接口把物体定位能力与机器人技能统一到单一 agentic 动作空间,缓解模块化策略仅按语义检索、缺乏显式空间推理的局限。
论文提出机器人策略框架 Agentic Scene Policies(ASP),通过 scene-agent 工具接口把物体定位能力与机器人技能统一到单一 agentic 动作空间,缓解模块化策略仅按语义检索、缺乏显式空间推理的局限。
论文提出 LYRA,一个人类引导的终身技能学习与代码生成框架,将人类反馈蒸馏为模块化可复用技能,并在外部记忆中存储技能与执行示例,借助检索增强生成和用户提示支持超长时程任务执行。
RoboFAC 提出一个面向 VLA 模型失败诊断与恢复的框架,构建了含 9,440 条错误操作轨迹、78,623 个 QA 对、覆盖 53 个仿真与真实场景的失败数据集,并训练出可本地部署的轻量多模态模型。实验显示其失败分析准确率比 GPT-4o 高 34.1%,作为外部监督器接入真实 VLA 控制流程后在四项任务上带来 29.1% 的相对提升,且延迟显著低于 GPT-4o;模型与数据集已公开。
论文提出 Ledger,一种从第一人称视频构建的持久 3D 物体记忆,结合物体位置、历史与上下文描述,可在物体离开视野后仍保留记录并回答空间问题。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
论文提出 contextual object placement 基准任务,即在观察到的携物过程中预测物体的目的地,并发布配套数据集 ECHO。
论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。
研究提出"时间可解释性"概念,通过动作分块(action chunking)改进可微决策树(DDT)在序贯决策任务中的表现,并给出两种融入动作分块的策略梯度算法与一种信息论树重构算法。在四个仿真环境中,从蒸馏的动作分块策略热启动得到的 DDT 效果最佳:在四个领域中的三个上匹配神经网络策略的性能,参数量最多减少 80%。代码已开源。
论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM),通过大规模操作视频继续预训练、蒸馏为单步视觉规划器,并以 mixture-of-transformers(MoT)架构引入动作模块,实现视频预测与动作生成的零样本泛化。
一项针对人机协作(HRC)中 RLHF 的范围综述筛选 199 条记录并纳入 20 篇 2020-2025 年同行评审文献,作者称其为首个聚焦 RLHF 双向闭环设计的综述。随后开展的 VR 被试间实验用贝叶斯模型分析系统发起与用户发起反馈对机器人近端行为安全导航的影响,结果显示用户发起反馈能更好地捕捉感知安全,表明反馈时机直接影响反馈质量。
UltraWorld 提出一种自蒸馏方法,可在没有真实动作标注的情况下,把临床超声视频中的先验迁移到可交互世界模型。
论文提出 MeshSIPP,一种面向动态环境下非完整约束轨迹规划的高效算法,通过将运动原语作为空间束传播、用轻量包围区间检查筛选,并把昂贵的精确出发时间搜索推迟到原语到达终态时,来消除计算瓶颈;另加时间感知剪枝规则提前丢弃冗余时空分支。作者证明该搜索具备完备性与最优性,在超过 6,000 个基准实例和 ROS 2 实时仿真中,MeshSIPP 相比最先进的时空规划器最高获得 3× 加速。
WAPR 是一个零样本广角 6D 位姿精修模型,可对旋转偏差最大达 90 度的候选位姿进行精修,每个检测实例仅需 12 个候选位姿,单帧推理在 1 s 内完成,位姿估计吞吐量最高达每秒 25 个检测实例。
ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。
TERRA 用紧凑的时序效果(净特征变化加窗口内低阶动力学分量)描述状态转移,并提出 Effect-Anchored Transport(EAT),让潜在动作在其他初始状态下解码后锚定到源端观察到的效果,使其含义由跨上下文的作用而非单一转移决定。
RLHND 提出基于视频基础模型的手部跟踪模型,从单目第一视角视频联合估计手部位姿与贴近实际的触觉信息,缓解现有方法仅从裁剪帧回归位姿导致的不准确和物理不一致问题。
论文提出一种事件对齐的视觉动作推理框架,围绕交互事件组织视觉-动作预测,让 WAM 在每次想象推演中生成事件对齐的视觉上下文,对任务关键状态变化给予更细粒度的推理,对连接性过渡则粗粒度推进。
研究在目标条件策略学习中识别出一种"视界信息诅咒":增大目标重标注视界会显著削弱策略泛化与性能,即便测试时只评估邻近子目标序列,行为克隆(BC)策略仍出现严重的、依赖训练视界的性能退化,而强化学习(RL)目标可缓解该现象。作者将其解释为动作与事后重标注目标之间条件互信息随视界下降,并发现将短视界策略的输入 Jacobian 蒸馏到长视界策略可在组合操作任务上带来显著性能提升。
GUARD 提出一种几何不确定性感知框架,在单次前向传播中同时完成点云滤波与分割,用于机器人硬盘拆解中的部件识别。该框架结合多尺度几何 Transformer 与多带宽随机傅里叶特征高斯过程估计逐点几何不确定性,并辅以预测熵抑制不可靠测量。
论文提出一种可扩展的异构图神经网络(GNN)框架,用于自动生成和评估多智能体共享路图,将路径点、智能体位置和任务位置表示为异构图中的不同节点。模型在专家求解器轨迹聚合的占据密度图上训练,学习识别关键兴趣点并剪除冗余节点与边,生成紧凑、协调感知且对任务排列不变的路图。实验显示该框架在稠密路图上可将运行时间和图规模至少降低 40%。
LASER 提出一种离线强化学习算法,通过隐空间伴随匹配实现熵正则化的隐空间强化学习,在保持表达性流策略的同时避免通过时间反向传播。在 40 项不同数据集质量的 OGBench 任务上,LASER 取得 state-of-the-art 性能,且在所有任务上使用固定的、与任务无关的超参数,优于包括按任务和数据集专门调参的基线方法。该论文已被 NeurIPS 2026 接收。
RoboPrompt 是一个轻量级机器人策略引导系统,用户通过绘制轨迹、目标点和粗略方向指令等稀疏输入引导策略行为,将人类意图翻译与基座策略解耦,在噪声空间控制动作生成,无需修改基座策略架构或为其微调。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
论文发现 VLA 模型对指令措辞高度敏感,$π_{0.5}$ 在 LIBERO 上对 switch on the stove 成功率 100%,对 switch on the hot plate 仅 2%,改写增强微调后的 $π_0$ 仍波动达 61 个百分点。
论文提出一种分解式触觉表示与控制框架,将法向力与接触斑映射为可从传感器读数恢复的有效接触响应,并把响应分解为接触几何、力分布和时变接触三部分分别编码与随机化,Tactile Gated Policy 在控制中保留这些表示且无需重训练即可覆盖所有掩码配置。
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
论文提出 Agentic Real-to-Sim-to-Real(Agentic RSR)框架,把场景重建、策略开发与真机执行通过同一操作任务串联起来:给定工作空间视频、任务描述和已知机器人模型,智能体恢复度量尺度、用视觉反馈迭代细化场景并在 MuJoCo 中检查任务相关交互,再由编码智能体从特权物体位姿逐步过渡到视觉观测和随机化仿真,生成可执行策略。
一项研究提出基于释放状态的模型化框架,让 6-DoF 机械臂投出能飞回的回旋镖,据称是首个实现回旋镖返回飞行的机器人机械臂。演示中回旋镖以 51 rad/s(8.1 rev/s)释放,飞至距基座 2.03 m 处并落回 0.31 m 内。成功释放与实测人类投掷差异显著,表明机器人无需模仿人类动作即可实现返回飞行。
论文提出感知辅助的高度自适应规划框架CMP-IRRT*,即Channel Mamba PointNet引导的Informed RRT*规划器,用于四足机器人穿越低矮障碍。
论文提出 LLA-MPPI(Look-back and Look-ahead Adaptive Model Predictive Path Integral control),把全身自适应转化为在一组 GPU 批量接触仿真器(物理或结构参数不同)上的选择,用窗口化预测误差选出最能解释近期运动的模型,再由全身 MPPI 规划器在该模型上优化控制,无需离线训练且所选假设物理可解释。
FoldBack 是一种面向长程衣物折叠的自纠错掩码生成策略,围绕三个推理时决策构建恢复机制:何时精修与验证、如何回滚、以及在何处及如何重试。它将精修与抓取校验对齐到 pick-and-place 事件,把机器人退回可重试的预抓取构型并保留成功抓取,选择性重新生成失败片段及部分后续动作,同时避开此前失败的抓取位置,无需恢复演示或基策略重训。
RFPO 是一个面向连续机器人控制的流策略优化框架,用 Reward-aware 在线 Reflow 修正学生策略的传输路径,并以冻结的 Gaussian PPO 控制器在完整与中间积分预算下提供动作空间监督,使部署策略只需单步 Euler 积分即可执行。
AirGroundVLN 提出面向目标导向空地协同视觉语言导航(VLN)的大规模基准,包含 19 个 Unreal Engine 环境中的 10,281 个导航片段与 955 个目标实例,设有 seen/unseen 划分与 aerial-visibility 协议。
研究团队推出 RobotWorld,一个面向机器人任务的仿真测试基准,将指令与观测转化为物理任务执行。其 84 项任务覆盖操作、移动操作、运动、驾驶与空中控制,设有显式交互预算与可执行成功判定。
论文提出 RoboQuest 基准,用于评估智能体通过物理交互主动获取任务相关信息、据此调整后续动作并自主判断何时完成任务的能力。该基准包含十项移动操作任务,围绕搜索、基于操作的检查和交互式测试三类不确定性构建;作者通过统一视觉运动接口评测五个前沿多模态智能体,并测试了在完整轨迹演示上微调的 π0.5 策略。
论文提出OpenViTac,一个跨仿真与真实世界的视触觉机器人操作基准,将接触密集型操作归纳为四个触觉相关能力维度,并提供配对的仿真-真机设置,用于一致评测VLA、WAM和VTLA策略。
MultiFly 提供 17,272 个同步样本,覆盖 RGB、热成像、LiDAR 和 radar 四种模态,来自 4 个郊区场景,含 15 个语义类的逐帧标注以及标定和 GNSS-RTK/IMU 数据。
论文提出分层强化学习框架,将高频关节级运动执行与低频步态适应分离,后者显式最小化运输成本 CoT,并通过三阶段 Isaac 训练实现零样本 sim-to-real 迁移。
论文系统研究高分辨率动态触觉传感对灵巧机械手抓握稳定性预测的作用,采集了覆盖 200 个物体、共 10,000 次抓握试验的数据集,每只多指手配备四个 Digit 360 触觉传感器,同步记录视觉、本体感觉与触觉流。
论文对 π0.5 和 GR00T N1.7 两个 VLA 模型的语言接地能力开展机制可解释性研究,对其动作生成模块残差流施加 activation 与 attribution patching,并按同义替换、语义缩放、方向性破坏、随机物体替换、空字符串五种策略系统扰动 LIBERO 基准的任务指令。