GroundingVLN:以视觉 grounding 连接推理与动作的视觉语言导航
GroundingVLN 以视觉 grounding 作为推理与动作的共享接口,在结构化推理中锚定任务相关视觉证据,并预测与进度对齐的像素目标交由几何规划器转为基本动作。
GroundingVLN 以视觉 grounding 作为推理与动作的共享接口,在结构化推理中锚定任务相关视觉证据,并预测与进度对齐的像素目标交由几何规划器转为基本动作。
研究者将行为学习与时序组合分离,从同一离线演示训练无条件多模态扩散策略与语义预测器,由 LTL 自动机在部署时跟踪指令进度并按预测语义结果为策略动作打分,两个学习组件训练时均不接收规范,无需重训即可复用演示行为执行未见过的时序组合。导航环境、CALVIN 操作与真机实验显示,复杂时序指令与安全约束执行可靠,较时序逻辑基线显著提升。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
Mask2Real-WM 提出两阶段世界模型,将像素预测解耦为动力学模型与渲染模型,以分割掩码作为 Sim-to-Real 桥梁提升灵巧手可控性。动力学模型在覆盖完整手部运动的合成数据上训练,再仅用 2.5 h 真实演示微调并训练渲染模型。在 23-DoF 机器人系统上与四种模型对比,解耦模型经人工盲评可控性最强,且帧更清晰、感知质量相当。
论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。
推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。
该论文提出 MoRE(Mode Redirection),通过一次简短的 uncloning 步骤把临时模式分类器的重定向信号蒸馏进策略权重,使策略在零推理开销下抑制不想要的行为模式,并用 retain loss 保留期望模式的能力。
ResCue(Residual Spatial Cueing)把语言推导出的目标信息转成空间条件注入视觉策略:预训练 grounding 生成目标掩码,独立 cue 编码器将特征残差融合到空间 RGB 特征中,保留场景上下文并显式标出目标。
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。
推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。
Premover 是一个轻参数模块,可在指令输入过程中提前启动机器人执行,同时保持 VLA 主干网络冻结,通过学习得到的视觉-语言焦点图和动作就绪门降低交互延迟。
研究提出将 LLM 作为调优专家嵌入贝叶斯优化循环,为 FDM 3D 打印选择配置:近似评估器对候选配置打分并返回结构化诊断,LLM 据此提出自然语言调整并编译为机器可执行指导。
Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。
推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。
该研究提出一种免导数的 episodic 潜在策略改进方法,通过将初始噪声采样替换为精心选择的常量噪声向量(golden ticket),改进冻结的 diffusion 或 flow matching 策略。
浙江大学团队提出 TDC 方法,将力调节分解为可从仿真迁移的方向分量与可手动调节的幅值分量,仅用仿真数据即可实现自适应柔顺。方向分量由基于预训练 VLA 微调的视觉运动策略预测任务坐标系与控制模式向量,部署时由导纳控制器结合人工指定刚度与目标力旋量实现柔顺控制。该方法已被 CoRL 2026 接收,在微波炉开门、插孔、白板擦拭和开门四个接触密集任务上取得较高成功率并对外部扰动具备鲁棒性。
研究在统一 VLM-hidden + diffusion-policy 范式下比较 InternVL3、Qwen3VL 与 ResNet、ViT、EVA-CLIP,发现策略学习扩大共享决策子空间但两分支保留不可迁移残差,纯视觉编码器在几何主导场景更强,VLM 在语义复杂长尾场景更有效。
TRACER 提出纹理鲁棒的可供性思维链框架,将高层语义指令映射为外观鲁棒、物理一致的可变形物体交互区域。框架包含树状可供性思维链 TA-CoT、空间约束边界细化 SCBR 与交互收敛细化流 ICRF,抑制边界溢出并整合分散的可供性响应。在 Fine-AGDDO15 数据集与真实机器人平台上,TRACER 提升多纹理可供性定位精度与长程操作成功率,源码与数据集将公开。
Po-Chen Ko 等人提出 RELIC,一种面向机器人操作的视频重规划框架,通过优化捕捉环境隐藏物理属性的潜变量嵌入,并用基于拒绝的采样过滤与既往失败不一致的假设,从而在测试时失败中适应推门还是拉门、摩擦等只能靠试错揭示的属性。
ZeST 将重复的 VLM 输出作为随机测量并融合为不确定性感知后验,实现零样本可通行性预测,避免机器人进入危险环境采集真实数据。在受控室内与非结构化室外环境中,ZeST 以最高 4s 推理延迟取得 90-100% 导航成功率,持续抵达最终目标,优于其他先进方法。
DAHLIA 提出一种数据无关的代码生成框架,将长程操作任务建模为回合式任务规划与评估,用渐进组织的上下文示例和 chain-of-thought 推理引导 LLM 合成可执行代码计划。
Wancong Zhang 等人提出 H-JEPA,一种端到端训练分层 action-conditioned JEPA 的方法,各层在自己的潜空间中预测更远的未来,规划自顶向下逐层生成子目标。
RealtimeWAM 提出一步动作生成与异步推理的 World Action Model,针对动作专家内部多步去噪和视频与动作专家串行等待两个瓶颈。
推荐理由:论文用一致性蒸馏加跨专家流水线压缩 WAM 推理,给出的加速比和精度损失数据可为实时机器人策略选型提供参考。
KineWorld 提出传输感知世界建模框架,把机器人运动学从动作条件扩展到生成监督的空间分配,通过 Kinematic Transport Lifting(KTL)构建渲染器派生、相机对齐的传输场,并用 Transport-Aware World Diffusion(TAWD)在视频潜空间网格上校准运动支撑、重加权未来 RGB 流匹配。
EpicWorldModel 用 flow-matching 目标训练随机 JEPA,在部分可观测、存在遮挡的环境中直接预测多个潜在未来状态,并以 flow 预测方差作为探索信号融入 CEM 规划。隐空间规划实验中该方法在各任务上取得最佳或持平表现,成功率较 LeWorldModel 最高提升 22%。论文已被 NeurIPS 2026 接收。
论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。
推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。
论文提出 PIVOT-Q,一种面向脆弱状态的 On-Policy Distillation 框架,用冻结的全精度策略作教师,选择性纠正量化学生策略 rollout 中的脆弱状态。
StageVLN 提出一种训练框架,用冻结的几何基础模型提供多级空间引导,并以相对朝向与专家路线进度目标补充轨迹状态监督,辅助组件仅在训练期使用、部署时移除。在 R2R-CE validation-unseen 上,StageVLN 以 4B 参数骨干取得 56.3% SR 与 51.4% SPL,推理阶段无需额外几何编码器;在 RxR-CE 上取得 54.3% SR,且不引入额外导航训练数据。
SAPrune 是一种免训练的视觉 token 剪枝框架,用小型校准集观察动作-视觉注意力随层的变化,在注意力模式更可靠后再选择剪枝层,并在每个选定层采用双路径规则保护高注意力 token 与有用上下文。
VICS-G 通过可行未来解码在冻结的视觉-语言-动作(VLA)策略上重排候选动作,在 Safety-CHORES 的六项设置中将平均累计安全成本降低 1.9%-57.5%,成功率与策略采样相比保持在 2.5 个百分点以内,平均回合长度相差 0.82 步。该方法以报警触发、免训练的重排器形式实现,无需重训基础策略,也无需在线轨迹 rollout。
提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。
一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。
推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。
GeoBridge-VLA 提出一种两阶段方法,从预训练 VLA 的冻结视觉编码器中学习几何特征用于动作预测,Stage I 训练 feature bridge 与 geometry decoder 并用深度监督,Stage II 冻结这些模块后训练门控残差接口与动作侧投影及 action expert。
LightVLN 提出轻量化历史感知空中视觉语言导航框架,用 0.5B 语言骨干配合紧凑历史与当前观测表示,将当前观测从 256 个视觉 token 压缩到 32 个,最多 16 帧历史下策略仅用 48 个观测 token。
提出一种三值时序逻辑的概率松弛方法,通过多项式代理网络在同一网络中同时计算数值与梯度,并在真实数据上保留精确判定。该松弛网络可作为梯度控制综合的目标函数,支持离线与在线机器人控制。研究在两个机械臂任务上验证,涉及子任务的中间检查与排序,展示了正确且及时执行的效果。
PermVLA 提出因果锚定置换(CAP),把动作揭示顺序作为 VLA 学习中被忽视的正则化选择,用可调时序前缀采样动作揭示顺序,从同一专家动作块构造条件集增强,无需新增演示数据。
论文提出 Video2World 基准,将自主视频到仿真构建形式化为软件工程任务,包含 222 个重建实例,源自 189 段机器人与人类演示视频,从几何保真度、动态保真度和功能正确性三个维度评测。
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。
研究者提出分层规划框架,用 p-cRVAE 学习线性化物理模型的残差修正,从抓取点观测预测 40 步规划时域内的完整布料构型,并嵌入 MPPI 规划器与 MPC 层完成双臂移动机械臂全身控制。
SimForcing 提出仿真引导框架,通过潜空间运动蒸馏与多块仿真条件注入(含条件 dropout)把仿真运动先验迁移到真实域机器人世界模型,推理时无需额外世界模型。
MarvisNav 是一个零样本物体导航(ZSON)框架,把候选节点及其探索状态投影到第一人称视图上,作为带记忆的视觉路径选项,让 VLM 无需额外融合或重排序即可同时评估目标相关性与探索进度。