Juno:用动作条件 JEPA 统一 VLA 的预训练、策略学习与部署
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
论文提出 ΔWAM,通过动作切线场(Action Tangent Fields)对动作如何诱导未来动力学变化做局部 Taylor 展开,把世界监督重新表述为与动作紧密耦合的一阶结构,并蒸馏进 WAM 的去噪监督。
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。
论文提出 RoboPace,一个面向动作块策略的在线重定时层,在保留策略几何路径的前提下按预测接触调整执行速度,同时兼顾接触相关速度限制与机器人运动学、动力学约束,无需重训练策略即可实时运行。在双臂机器人的三个接触丰富任务上,快速均匀执行和仅按物理限速的重定时大多失败,而 RoboPace 的整体成功率高于慢速均匀执行,并在约一半时间内完成五条指令中的四条。
一项研究提出面向机器人控制的自适应代码生成架构框架,采用双 AI 设计:LLM 将高层意图翻译为限定在形式化机器人库内的可执行程序代码,VLM 通过蒸馏过程提供语义锚定。框架引入基于几何与语义阈值的环境驱动重规划触发机制,配合持续运行时监控与自适应规划循环。在前沿模型上的基准测试表明,将生成式 AI 置于响应式受限循环中,可在动态未知环境下稳健完成复杂意图。
论文提出 SOUL(Sparse feature pOlicy UnLearning),针对 VLA 模型反复出现的状态幻觉问题,选择性遗忘与幻觉行为相关的策略知识,其中幻觉失败与成功行为对应的稀疏特征分别作为遗忘和保留目标。
论文提出 TMT,一种基于 Token Manifold 与潜空间 Transition 建模的运行时后门检测器,用于在未见任务上检测被植入后门的 VLA 策略。
论文提出 RobotAPO,一个在连续 flow-matching 去噪空间中运行的对抗式物理偏好优化框架,用于机器人操作视频生成,并发布 AgiBot-PhysPref 数据集,含 10,000 条隔离条件匹配物理违例的偏好样本。
TempoBridge 是一个轻量框架,利用冻结的 VLA 表征按指令中的节奏线索在各任务阶段调制动作,无需额外的节奏条件机器人演示或针对节奏的基策略微调。它从上下文 VLM 表征中提取节奏线索,通过因果阶段路由与任务进度对齐,并在执行中调制标称运动指令。
RoboRender 是一个将模拟轨迹转换为照片级 RGB 视频的框架,以模拟深度视频、语言指令和机器人 RGB mask 视频为条件训练面向机器人的视频生成模型,在保留模拟器几何、机器人运动和动作标签的同时合成真实纹理、背景与干扰物。
论文提出 Robo-COP,让 VLM 编排器与 VLA 策略在部署过程中协同演化:从自身执行中整理技能演示,在数据能解决反复失败时微调策略,并在新策略确实提升对应技能后才采纳。
论文提出 ProAct 动作分词器训练方法,在重建目标之外增强下游可预测性与鲁棒性,该方法与策略无关且仅用动作数据训练。在 Robomimic、LIBERO、RoboTwin 基准及多种分词器架构上,ProAct 平均提升 rollout 成功率 11.3 个百分点,迁移到视觉语言动作策略和真实机器人操作时分别平均提升 21.8 和 36.7 个百分点。
论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。
论文提出一种基于 Vision-Language Models 的上下文感知自适应喷药框架,让机器人结合作物类型、农药类型和天气数据进行空间推理与喷洒决策,并用基于 Model Predictive Path Integral 控制的轨迹跟踪控制器保证导航与喷洒精度。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
DAEDALUS 通过配对 explorer 与 solver 两个智能体,从自生成任务的失败中提炼启发式规则并汇总为记忆库,在 AppWorld、τ^2-bench 和 AutomationBench 上将平均成功率较无记忆基线提升最多 15.9 点,pass^5 提升最多 2.2x,推理成本低于多数使用训练任务的方法。
跨 Tokenizer On-Policy 蒸馏研究发现,严格 1:1 对齐位置已覆盖学生生成的大部分 token,将 reverse KL 限制在每个严格位置的共享词表 top-16 子集即可达到与全共享词表 OPD 相当的准确率。
PointZero 提出以 3D 点轨迹补全作为预训练目标,仅凭单帧 RGB-D 观测和稀疏部分 3D 轨迹预测所有观测点的未来 3D 轨迹,无需机器人动作标签即可学到 3D 动力学先验。
推荐理由:论文提出无需机器人动作标签的预训练目标,可帮助理解如何利用网络视频数据学习 3D 动力学先验。
论文提出从 DINO 残差中学习的残差潜在动作(RLA)表示,并据此构建 RLA World Model(RLA-WM),通过 flow matching 预测 RLA 值,在仿真与真实数据集上超过现有特征式与视频扩散世界模型,速度比视频扩散快若干数量级。
研究提出 Completion Aware Guidance(CAG),一种无需训练的采样方法,将 World Action Models 的生成引导向任务完成。在 RoboTwin 2.0 子集上成功率从 64% 提升至 70%,零样本仿真中从 69% 提升至 75%,任务未完成想象比例从 79% 降至 40%。
研究团队提出 FineART 双臂操作数据集,包含 40,543 个 episode(1,718 小时)、533,913 个子任务、覆盖 151 项任务,并开源数据集、模型权重与训练代码。
推荐理由:论文给出子任务标注带来的成功率提升幅度,可评估密集标注对双臂长程任务的价值。
论文提出 Atomic Motion Coordinate(AMC),为 VLA 策略提供几何锚定的坐标,使仅改语言指令即可重定向末端执行器并响应接触力。每条机械臂拥有 13 个带符号的平移、旋转与保持原子,经加权码本对齐注入每个动作专家模块。在 7,520 次离线干预中,反向原子分离率达 92.5/83.1%(单/双臂),50 次真机试验中 OOD 水果任务进度从 60.5% 升至 87.8%。
论文提出 VLAct,一种面向 Vision-Language-Action 模型的 VLM 骨干,在任务微调前于多本体机器人数据上继续预训练,通过 VLM 先验保持、多头连续动作协同监督和部分统一的跨本体动作布局来保留通用视觉先验并共享动作语义。
PhysCaP 提出一种面向机器人操作主动感知的 Physics-Informed Code-as-Policy 智能体系统,通过免训练的物理属性提取模块,仅凭机器人本体感知即可估计物体质量与刚度,无需额外传感器。
GAF 通过学习约 2.735M 参数的紧凑 critic 并将其动作梯度作用于逆时流采样,在不更新 0.45B 参数 VLA 策略参数的前提下提升推理时动作生成质量。
该论文对行为提示(behavior prompting)何时、如何生效进行了实证研究,引入 DrawAnything 和 LIBERO-Gen 基准(最多 2000 个程序生成任务)、上下文视觉运动架构 Behavior Prompting Policy(BPP)以及手持演示接口 iPhUMI。
推荐理由:论文用消融实验指出任务多样性比单任务演示数更关键,做数据采集取舍的团队可参考这一结论。
GeoAlign 提出一种状态引导的空间对齐架构用于 VLA 策略学习,通过离线 RGB-D 监督后训练几何分支生成 GEP 特征,再丢弃深度头,仅用 RGB、语言与本体感知状态完成策略训练与执行。
论文提出 VLLR 稠密奖励框架,结合 LLM/VLM 的外部奖励与策略自确信度的内部奖励,在无需人工设计奖励的情况下微调机器人基础策略。LLM 将任务分解为可验证子任务,VLM 估计进度以初始化价值函数并仅用于短暂热身阶段,自确信度则在 PPO 微调全程提供逐步内在引导。
MRPilot 是一个混合现实系统,围绕 Forming、Reviewing、Following、Repairing 四个阶段监督和干预基于 LLM 的多机器人团队,将机器人团队计划与执行状态表示为跨同步就地视图和总览视图共享的结构化承诺。
一项研究将视觉语言导航(VLN)从仿真环境迁移到真实世界,在自建的 Ackermann 转向移动机器人上实现离线导航。该系统采用 Cross-Modal Attention(CMA)架构,通过线性光度调整和少量真实数据微调完成域适应,无需导航图或全景视图。实验以 SPL 和 nDTW 指标评估,验证了方法的鲁棒性与适应性。
DepthWorld 提出一种结合学习式立体深度与联合因子图的标定流程,将 DROID 数据集标定为提供稠密度量深度和多视角外参的 DROID-3D,外部相机在 90% 的 episode 上重投影误差 <0.7 px。
推荐理由:论文解释了RGB-only世界模型几何不一致的成因,并给出可迁移的标定与深度监督思路。
EgoLAP 提出一种 VLA 预训练框架,通过共享的语言动作链式思维联合学习人类与机器人轨迹,将运动意图表达为结构化、时间抽象的语言动作。在真实世界与仿真实验中,EgoLAP 达到 80.1% 的真实任务平均进度,较其他动作表示方式取得 2.3x 性能提升。运动级推理也优于结合子任务、目标框与视觉轨迹的复合推理格式。
论文提出 Loss-Conditioned Activation-Moment(LCAM)剪枝方法,一种面向预训练机器人操作策略的免训练非结构化剪枝方案,通过自递归由粗到细流程在剪枝后无需恢复训练与仿真 rollout。
WareFly-VLA 发布了一套面向智能仓库的无人机 VLA 框架与数据集,包含 507 段人工遥操作飞行片段和 8,504 帧高分辨率 RGB 数据,均采集自 NVIDIA Isaac Sim,并配有目标工人的外观描述与四自由度同步控制指令。
MIM-VLA 用夹爪电流、位置、速度和信号有效性编码为 128 维交互 token,预训练后仅调节 SmolVLA 的夹爪动作通路,手臂动作与位置控制接口保持不变。在三个真实场景、13 对物体的测试中,MIM-VLA 选择高阻力物体的比例为 75.0%,SmolVLA 基线为 48.8%;该方法仅使用夹爪已有电机反馈,无需额外触觉阵列、力矩传感器、标定力估计或直接电流控制。
一项机器人研究提出事件驱动的主动辅助框架,通过事件监视器捕捉人-物交互的状态转移,用冻结的预训练 Vision-Language Model(VLM)推断任务上下文并生成辅助动作序列。该框架在三个真实桌面协作任务上无需任务特定训练或微调,性能与提供用户指令的变体相当。
VOMMI 是一个便携演示采集与学习框架,通过离线轨迹重建和在线视觉运动条件化,把 RGB 演示接入视觉语言动作(VLA)后训练,无需人机运动学对应标定。实验每个任务采集 500 条便携轨迹,其中 75 条留作 RGB-VO 评估,另用 200 条机器人演示作参照;仅用便携演示后训练的策略基座速度误差比用机器人演示训练的低 18.2%,末端执行器平移精度相当。
论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。
推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。
ViDAL 提出一种以未来场景视觉动态为锚的连续动作隐空间,通过训练 Action VAE 重建动作块并将隐变量与未来场景动态对齐,可作为即插即用的动作接口兼容多种 VLA 架构。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。