AutodidactWAM:从生成视频到机器人动作的跨模态自蒸馏方法
论文提出 AutodidactWAM,用无需遥操作训练的手部姿态估计加逆运动学从模型生成视频中恢复动作估计,与原生动作配对后仅微调动作相关层。
论文提出 AutodidactWAM,用无需遥操作训练的手部姿态估计加逆运动学从模型生成视频中恢复动作估计,与原生动作配对后仅微调动作相关层。
IronMan 提出基于信息瓶颈原则的视频-动作学习框架,通过动力学感知瓶颈抑制无关视觉信息、保留动作相关动态线索。在 LIBERO 上达到 99.0% 成功率、RoboTwin clean2clean 上达到 79.4%,均超过所有评测基线。在 OOD 偏移下,LIBERO-Plus 成功率 79.1%,比最强基线高 10.4 个百分点。
SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。
OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。
推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。
StairVLA 提出阶段感知分层动作生成框架,用部分去噪动作作为粗粒度长时程生成与局部精修的接口,高层 VLA 负责早期去噪,轻量 refiner 以更高频率用最新观测精修局部动作块。
ESP(Energy-Score Policy)提出一种免蒸馏方法,用单次网络评估将策略上下文与噪声直接映射为动作块,动作头以 energy score 而非均方误差训练,实现对多模态动作分布的直接学习。仿真与真实操作任务实验显示,其任务成功率与 flow matching 基线相当,而动作生成时延大幅降低。
SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。
推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。
NeurIPS 2026 接收的论文提出 OntoPlan,一个基于本体场景表示的智能体框架,用于机器人任务规划。在覆盖 5 个室内环境、3 种场景规模的 150 项通用任务上,OntoPlan 平均任务成功率达 0.89,最强基线仅 0.27;平均每任务消耗 18.1k tokens,约为最高效基线的 1/5.6。场景规模增大时优势保持,且能对模糊或不可行指令追问或报告信息不足。
TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。
一篇 arXiv 论文提出在世界模型(WM)隐空间中建模隐空间扰动,通过动力学感知相似度度量与分布外检测构建合理隐动力学集合,并用 conformal prediction 校准不确定性集合,再以博弈论优化联合求解鲁棒机器人动作与最坏情况扰动。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
OpenSplatGraph 提出一个统一框架,直接从在线 Gaussian 开放词汇语义地图构建持久化 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件化的对象提取,并将对象实例关联到持久图节点以增量更新属性与关系。该框架在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的在线开放词汇感知与下游任务性能,已被 ACCV 2026 接收。
论文提出即插即用的物理引导视觉提示(PG-VP)模块,通过在冻结的 VLA 模型输入上叠加随帧移动的虚拟障碍物,使导航策略绕开辐射与温度等不可见危险,无需重新训练。
该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。
LEAP 通过辅助解码器从视觉特征重建操作工作空间内的点云,并引入腕部视角 dropout 与部分重建目标,缓解本体感知捷径、主导视角依赖和任务无关几何主导重建这三类问题。
ProactiveVLA 在完成初始任务后,将剩余交互预算分配给智能体自提的目标,覆盖物体可供性、状态改变交互及其组合,并把任务导向与探索性经验统一整合进记忆以指导后续规划与控制。
SWAP 框架在机器人执行过程中动态组合多个 VLA 策略,将策略路由建模为离线强化学习问题,学习一个路由 critic 在每个决策步根据当前观测选择最合适的策略,而非整个回合固定使用单一策略。
研究在冻结的 π0.5 策略上对 RoboTwin 四项任务进行 3,888 组配对回合评测,学习式纠错仅在 hammer 任务上将成功率提升 +13.5pp(95% 区间 [+9.4,+17.7]),其余三项无显著增益。
研究者提出 Manipulation-Grounded Visual Question Answering(MG-VQA)任务与 MG-VQA-Bench 基准,包含 600 个人工核验问题、覆盖 4 类空间推理任务,并在杂乱桌面交互环境中评测 8 个 VLM。
LoopVLA 提出跨子任务事件记忆接口,将刚完成的子任务压缩为记忆供下一子任务的动作专家调用,以支持重复执行与停止决策。可学习事件隐变量查询已闭合片段的 token,动作特征查询历史与联合历史-事件上下文,两路读出经残差融合注入动作头。在记忆基准上,LoopVLA 配合在线子目标预测在重复任务组取得 80.22% 成功率,整体成功率优于强记忆基线。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
DyQ-VLA 是一个面向运行时误差的 VLA 量化框架,按执行步动态选择激活精度,并通过累积量化残差跟踪和补偿旋转误差。论文对比全精度与量化模型的误差分布发现,量化会放大平移误差分布的方差与离散度,而旋转误差分布中心随执行步逐渐偏移,呈现累积漂移。实验显示 DyQ-VLA 实现 1.88 至 1.93 倍推理加速,平均任务成功率持平或更高,并将平均执行步数减少 17.7% 至 19.8%。
一项研究系统评估了 Vanilla BC、LSTM-GMM、IBC、Diffusion Policy 与 VQ-BET 等模仿学习算法在白盒、灰盒和黑盒对抗扰动下的脆弱性。
推荐理由:论文给出白盒与黑盒迁移攻击下的成功率下降幅度,可作为评估模仿学习策略鲁棒性的对照基准。
Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。
UniWAM 提出一种统一架构,将物理推理器、世界生成器与动作预测器结合,共同学习物理世界的语义理解、视觉生成和动作预测。论文针对人类第一视角数据与机器人数据建立了数据清洗与标注流程,用自然语言表示低层动作,并在后训练中引入未来视觉噪声增强与基于历史条件的 flow matching,以减少去噪步数并保持性能。
论文提出 Embodied Agent Arena,用 1,000 个案例评测七个 VLM 智能体在几何、空间推理、可供性、任务规划和操作五类能力上的表现,案例取自 32 个已有来源并新增几何估计基准 GeoProbe,覆盖 Blender 渲染图与真实场景图像。
Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。
Token-World 是一种动作条件世界模型,将 VLM 特征压缩为紧凑 token 状态,在降维空间学习未来动态并映射回策略表示,用于机器人操作。在闭环评估中,其模拟策略性能与参考策略的相关性高于 Ctrl-World(r=0.794 vs. 0.583),且仿真时延更低。消融实验显示紧凑表示的设计与维度显著影响未来状态预测,代码将开源。
Magic-W0 提出结构化世界-动作基础模型,将交互建模为由 Current State、Transition、Future State 组成的 Structured World Transition,并以层对齐架构耦合世界转移预测与动作生成。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
EmbodiRSI 是一个面向 real-to-sim-to-real 的递归自我改进(RSI)agentic 系统,从目标部署场景构建任务专属仿真,用策略执行反馈引导经验采集与策略更新,包含 Collaborative Error Correction 与 Adaptive Data Collection 两个互补机制。
DODGER 是一个安全引导强化学习框架,直接执行策略生成的动作驱动训练 rollout,同时用 CBF 过滤参考与约束违例塑造避碰行为,避免仅执行安全过滤动作限制策略探索。该方法经 Dubins-car 安全分析验证,并在全尺寸人形仿真与真实人形机器人实验中基于 LiDAR 感知完成多动态障碍物目标导航,运行时无需安全过滤器。
论文提出 actualization 任务,在冻结的视频世界模型之上用轻量模型选择并实现任务对应的未来状态,据此输出机器人动作。作者实现的 RoboActualizer 仅 60M 参数,由两个 DiT 专家通过 flow matching 联合预测未来 latents 与动作,可在单张 32 GB 显存 GPU 上训练完成。
斯坦福等机构研究者提出 DexAgent,一个 agentic Human2Sim2Robot 框架,把单段第一视角人类视频和任务提示转成可用于策略训练的物理可落地机器人轨迹。
论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。
推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。
Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。
研究在 FANUC 与 xArm 两台真实商用工业机械臂上实证评估了基于学习的机械臂操作后门攻击与防御,验证后门可在常规任务执行中保持隐蔽、仅在特定触发器出现时诱导语义错误的抓取行为。作者提出一种在线防御流程,在运行时检测并中和触发器,并与离线微调防御对比效果。评估还测量了防御流程引入的计算时延与执行开销,以判断其是否适用于高吞吐工业场景。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。
提出 FOM-SAM3 框架,从少量多视角配准图像学习可复用的细粒度物体记忆 token,同时保持 SAM3 完全冻结,通过一对多学习定位目标物体并排除相似干扰项。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。