Rolling-WAM:用滚动想象实现世界动作模型
Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。
Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。
NavProbe 提出一种分层零样本导航智能体,用动态子目标议程配合主动证据检索,在上下文不足时按需调取视觉与几何记录以生成、修订或解决子目标。在 R2R-CE 上取得 71.7% SR 与 55.8% SPL,RxR-CE 上 55.3% SR 与 38.6% SPL,超过强零样本基线;HM3D-v2 ObjectNav 上 SR 达 79.3%。代码已开源,并有真实机器人定性演示。
研究在 FANUC 与 xArm 两台真实商用工业机械臂上实证评估了基于学习的机械臂操作后门攻击与防御,验证后门可在常规任务执行中保持隐蔽、仅在特定触发器出现时诱导语义错误的抓取行为。作者提出一种在线防御流程,在运行时检测并中和触发器,并与离线微调防御对比效果。评估还测量了防御流程引入的计算时延与执行开销,以判断其是否适用于高吞吐工业场景。
NavSafe-∞ 提出一个照片级真实的闭环驾驶安全基准,包含 280 个场景、28 类事件,并按交通事故、弱势道路使用者碰撞、交通违规、交通事件四类给出能力评分。在评测 20 个端到端驾驶策略后发现,开环指标提升并不能可靠转化为闭环安全表现。基准与可扩展的事件编排、策略诊断工具箱将开源。
Dr-LiSA 提出首个将 2D 旋转雷达强度测量在 SE(3) 中与 3D 激光雷达地图配准的直接方法,通过学习式前向模型从候选位姿的激光雷达子图预测雷达测量,实现预测与观测雷达扫描的直接光度对齐。在超过 90 km 道路数据上,其 SE(2) 精度超越既有雷达-激光雷达方法,并与最先进雷达-雷达定位的平面精度相当。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。
提出一种基于切换的自适应控制框架,用于空中机械臂在任务执行中应对动态切换工况,无需预先获知飞行器与机械臂耦合及状态相关不确定性。框架给出一类切换信号,刻画可保证系统稳定的过渡阶段。对比实验验证了该框架相对现有方法的有效性。
提出 FOM-SAM3 框架,从少量多视角配准图像学习可复用的细粒度物体记忆 token,同时保持 SAM3 完全冻结,通过一对多学习定位目标物体并排除相似干扰项。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。
GroundingVLN 以视觉 grounding 作为推理与动作的共享接口,在结构化推理中锚定任务相关视觉证据,并预测与进度对齐的像素目标交由几何规划器转为基本动作。
研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。
GraRe 通过学习式重排序改进冻结 6-DoF 抓取检测器的候选排序,从候选属性、分层局部几何与物体上下文三类特征估计抓取质量,经 Transformer 融合后与检测器置信度合成最终排序。在 GraspNet-1Billion 上对 5 个冻结检测器实验,Average AP 最高提升 13.56 分,真实机器人实验验证了杂乱场景下的鲁棒抓取。项目代码已开源。
Arm2Air 将预训练 Neural MP 模型生成的机械臂避障骨架迁移至 UAV 中继部署,用少量目标域数据配合 Low-Rank Adaptation 微调 transformer 迁移平台。
BC-NMPC 将电池与推进系统模型集成进 NMPC 框架,实时预测 UAV 的电压、电流、功率与最大可用推力,以应对高速敏捷飞行中电池耗尽导致的推力损失。实飞验证了模型精度,仿真评估了重规划算法;电池容量耗尽时,相比无感知控制器,不重规划平均位置误差降低 25%,重规划降低 88%。该方法使 UAV 在任务全程保持时间最优飞行。
PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。
CERPE 是一个系统级框架,通过协调视觉基础模型联合估计自运动与机器人间相对位姿,用于短暂协作感知场景。该框架以持续共享的固定大小描述子触发事件驱动的原始图像请求,并通过度量尺度化的自运动传播相对位姿,即使无视觉重叠也能维持估计。仿真与真实机器人实验显示,CERPE 在 6-DoF 相对位姿估计上优于所选基线方法。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
研究人员提出 CORL-AUV,用 CFD 数据训练阻力代理模型(SDM)替代逐步求解 CFD,在强化学习训练管线中将阻力估计加速 700000 倍,并据此训练 PPO 策略零样本部署到 6-DOF AUV。
GEM-Occ 提出 Gaussian Evidence Memory 框架,将多视角累积的几何与语义证据整合为持久的语义占据记忆,支持跨房间的持续建图与高效查询。团队同时发布 HIOcc 基准,统一语义标签空间与评测框架,覆盖局部预测、房间级在线建图和建筑级建图。实验显示 GEM-Occ 在 HIOcc 上优于现有方法,兼顾内存占用与占据查询速度。
Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。
论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。
推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。
该研究提出一种可重构摇臂-转向架机构,通过在转向架关节安装电机主动摆动,在四轮与六轮构型间切换,转向架末端安装全向轮实现四轮差速转向。样机实验显示,其零半径转向速度超过传统六轮摇臂-转向架机构 5 倍,平均轮端总扭矩仅约 17%。机器人成功攀爬 40 cm 台阶,平均攀爬时间 6.4 s。
该论文提出 MoRE(Mode Redirection),通过一次简短的 uncloning 步骤把临时模式分类器的重定向信号蒸馏进策略权重,使策略在零推理开销下抑制不想要的行为模式,并用 retain loss 保留期望模式的能力。
ResCue(Residual Spatial Cueing)把语言推导出的目标信息转成空间条件注入视觉策略:预训练 grounding 生成目标掩码,独立 cue 编码器将特征残差融合到空间 RGB 特征中,保留场景上下文并显式标出目标。
通过方向性任务误差监督与任务误差模型驱动的样本选择,残差学习在 Barrett WAM 机械臂上实现稳定的三球、四球和五球杂耍,系统从第二次尝试即收敛,此后任务误差单调下降且无失败。对比显示,方向性反馈与信息性先验缺一不可,其中固定 Jacobian 的 Newton 更新最快且完全可靠。学习到的残差可容忍先验失配与关节跟踪退化,主要影响收敛速度。
CANMOT 提出面向 KF 3D 多目标跟踪的类别感知、目标对齐噪声建模框架,为不同交通参与者引入类别专属的过程与测量协方差矩阵,并可选地在目标坐标系下表达以保留纵横向各向异性。在 nuScenes 上的实验显示该方法提升跟踪性能并显著减少身份切换。基于 ANEES 与 χ² 违规检验的分析揭示标准 KF 基线存在严重过度自信,所提方法改善校准但仍存在明显不一致。代码已开源。
Hebero(Heterogeneous Benchmark for Robot Learning)是一个基于 GPU 并行 Isaac Lab 的基准,支持在全部 40 个异构任务上联合训练和评估单一策略。
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
BiMoSG 提出双模态 3D 场景图生成方法,面向开放集任务执行,默认以"fast"模式高效生成粗粒度场景图,遇到可能包含任务相关物体的区域时切换到"slow"模式生成细粒度开放词汇 3D 场景图。该方法生成速度显著快于开源 state-of-the-art 方案,可将场景图生成与任务执行集成,支持实时部署。
Victor Kowalski 等提出 VE2VF,用人在回路的强化学习与师生蒸馏,把依赖视觉的教师策略蒸馏到仅使用 pose、twist 和 wrench 传感的无视觉学生策略,全程在真实世界训练,无需 domain randomization 或数据增强。
FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。
推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。
Premover 是一个轻参数模块,可在指令输入过程中提前启动机器人执行,同时保持 VLA 主干网络冻结,通过学习得到的视觉-语言焦点图和动作就绪门降低交互延迟。
该自主机器人伤亡评估系统融合多种视觉算法输出,以专家规则构建的贝叶斯网络对伤情做概率推理,在 DARPA Triage Challenge 的 11 人与 9 人伤亡场景中,生理评估准确率从 15% 提升至 42%、19% 提升至 46%。整体分类准确率从 14% 升至 53%,诊断覆盖率从 31% 扩展到 95%。
研究者将时序行为树(TBT)重构为三值信号时序逻辑(STL)形式,引入第三真值 Unknown 以刻画轨迹既未完全满足也未违反规范的情形,并为部分轨迹 STL 与 TBT 提出混合整数线性编码。该编码通过混合整数优化为线性动力系统生成构造即正确的控制策略,论文已获 IEEE CDC 2026 接收。
该研究提出将深度确定性策略梯度(DDPG)强化学习与有界极值搜索(ES)结合的混合控制器,用于提升机器人推物和抓放任务在分布偏移下的鲁棒性。DDPG 策略在标准条件下训练,部署时叠加有界 ES,以应对时变目标和空间变化摩擦等超出训练分布的工况。研究证明机械臂可在有限时间内收敛到目标物体,随后有界 ES 实现对有界速度移动目标的有限时间收敛,并给出收敛时间解析公式与增益调节方法。
研究提出将 LLM 作为调优专家嵌入贝叶斯优化循环,为 FDM 3D 打印选择配置:近似评估器对候选配置打分并返回结构化诊断,LLM 据此提出自然语言调整并编译为机器可执行指导。
Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。
推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。
该研究提出一种免导数的 episodic 潜在策略改进方法,通过将初始噪声采样替换为精心选择的常量噪声向量(golden ticket),改进冻结的 diffusion 或 flow matching 策略。
研究团队发布 FoMo 多季节数据集,在北方森林中历时一年、12 次部署采集超过 64 km 的六条多样化轨迹,用于挑战现有里程计与 SLAM 流程。数据涵盖旋转与混合固态激光雷达、FMCW 雷达、立体与单目相机及两个 IMU,真值由三台 GNSS 接收机与静态基站后处理得到,并附气象站、相机标定和车辆功耗等元数据。
浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。