TAPDreamer:面向世界动作模型的可迁移对抗补丁攻击
TAPDreamer 提出一种仅依赖公开编码器、无需查询目标策略的世界动作模型对抗攻击,用单个冻结补丁(约占输入 6.5%)将 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而匹配的随机补丁仍保留 81.5% 和 79.2%。
TAPDreamer 提出一种仅依赖公开编码器、无需查询目标策略的世界动作模型对抗攻击,用单个冻结补丁(约占输入 6.5%)将 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而匹配的随机补丁仍保留 81.5% 和 79.2%。
Wancong Zhang 等人提出 H-JEPA,一种端到端训练分层 action-conditioned JEPA 的方法,各层在自己的潜空间中预测更远的未来,规划自顶向下逐层生成子目标。
研究者为 CADENCE 算法提出两种学习型角落选择启发式方法——基于网格编码的 CNN 评分器与在可见性图上用 Deep Q-Learning(DQN)训练的 GATv2 网络——在保留形式化覆盖与连通性保证的同时提升部署效率。
RealtimeWAM 提出一步动作生成与异步推理的 World Action Model,针对动作专家内部多步去噪和视频与动作专家串行等待两个瓶颈。
推荐理由:论文用一致性蒸馏加跨专家流水线压缩 WAM 推理,给出的加速比和精度损失数据可为实时机器人策略选型提供参考。
KineWorld 提出传输感知世界建模框架,把机器人运动学从动作条件扩展到生成监督的空间分配,通过 Kinematic Transport Lifting(KTL)构建渲染器派生、相机对齐的传输场,并用 Transport-Aware World Diffusion(TAWD)在视频潜空间网格上校准运动支撑、重加权未来 RGB 流匹配。
CentriQ 是一种免校准的 Diffusion Transformer(DiT)量化方法,通过在旋转前对每个 token 做均值中心化,并用 rank-1 全精度分支精确还原均值,使 per-token scale 可闭式求解。
EpicWorldModel 用 flow-matching 目标训练随机 JEPA,在部分可观测、存在遮挡的环境中直接预测多个潜在未来状态,并以 flow 预测方差作为探索信号融入 CEM 规划。隐空间规划实验中该方法在各任务上取得最佳或持平表现,成功率较 LeWorldModel 最高提升 22%。论文已被 NeurIPS 2026 接收。
RADPO 提出一种免模型的扩散策略优化方法,将预测首达安全估计与累积成本预算反馈结合,用于安全感知的连续控制强化学习。该方法学习折扣首达可达性值来塑造奖励,并用对偶式乘子按实际回合成本相对预算调整塑形强度,无需学习动力学模型、动作梯度或反向扩散采样器求导。在十项连续控制安全任务上,RADPO 取得有竞争力的奖励-成本权衡,多个任务的约束违反显著低于对比基线。
该研究首次给出未知输入驱动的非线性系统状态估计的通用结构解,提出 UID 诱导正规形,将未知输入信息分解为与可观测动力学结构解耦的方向和完全表征其影响的可观测量,无需对未知输入作模型或随机假设即可统一实现解耦与重构。在最小 Structure-from-Motion 配置中,仅用 3 个点特征和单轴陀螺仪即可递归估计状态,恢复三维结构与相机运动(差一个未知全局尺度因子),真实数据实验验证了可行性。
论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。
推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。
提出可控道路标线生成方法,从可行驶区域掩码、外环标线与文本描述合成缺失的中心区域标线布局,输出车道分隔线、道路分隔线与人行横道三类通道。系统采用文本条件 BEV 潜空间 rectified-flow DiT,配合拓扑感知辅助损失与免训练的 Structured Gaussian Render 后处理。
论文提出 PIVOT-Q,一种面向脆弱状态的 On-Policy Distillation 框架,用冻结的全精度策略作教师,选择性纠正量化学生策略 rollout 中的脆弱状态。
StageVLN 提出一种训练框架,用冻结的几何基础模型提供多级空间引导,并以相对朝向与专家路线进度目标补充轨迹状态监督,辅助组件仅在训练期使用、部署时移除。在 R2R-CE validation-unseen 上,StageVLN 以 4B 参数骨干取得 56.3% SR 与 51.4% SPL,推理阶段无需额外几何编码器;在 RxR-CE 上取得 54.3% SR,且不引入额外导航训练数据。
该框架将复合场景分解为原始场景、将规范分解为子规范,独立验证每个原始场景后用重要性采样与核密度估计组合统计估计,用于安全与 co-safety 规范的高效分析。实验评估显示,它能准确回答此前未见复合场景的验证查询,并通过并行化与轨迹复用降低仿真成本。该工作为 RV 2026 论文的扩展版本。
提出 VPGGT(Vision-Prior Geometry Grounded Transformer),一个基于 VGGT、扩展 OmniVGGT 的先验感知具身感知框架,用于处理含噪相机位姿并恢复物理尺度。
SAPrune 是一种免训练的视觉 token 剪枝框架,用小型校准集观察动作-视觉注意力随层的变化,在注意力模式更可靠后再选择剪枝层,并在每个选定层采用双路径规则保护高注意力 token 与有用上下文。
VICS-G 通过可行未来解码在冻结的视觉-语言-动作(VLA)策略上重排候选动作,在 Safety-CHORES 的六项设置中将平均累计安全成本降低 1.9%-57.5%,成功率与策略采样相比保持在 2.5 个百分点以内,平均回合长度相差 0.82 步。该方法以报警触发、免训练的重排器形式实现,无需重训基础策略,也无需在线轨迹 rollout。
提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。
一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。
推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。
GeoBridge-VLA 提出一种两阶段方法,从预训练 VLA 的冻结视觉编码器中学习几何特征用于动作预测,Stage I 训练 feature bridge 与 geometry decoder 并用深度监督,Stage II 冻结这些模块后训练门控残差接口与动作侧投影及 action expert。
LightVLN 提出轻量化历史感知空中视觉语言导航框架,用 0.5B 语言骨干配合紧凑历史与当前观测表示,将当前观测从 256 个视觉 token 压缩到 32 个,最多 16 帧历史下策略仅用 48 个观测 token。
研究将 Level-K 策略库的部署问题建模为部分可观测马尔可夫博弈中的动态编排,比较基于分类的编排器(CBO,使用离线数据或 on-policy 数据聚合训练)与强化学习编排器(RLBO)。在追逃实验中,on-policy 训练提升分类与回报,但 RLBO 回报高于 on-policy 与离线 CBO。给定预训练策略库,RLBO 以更少训练步数达到与直接在追逃者动作空间上训练的策略相当的性能。
研究者构建并评估了一套仅用单目相机与视觉惯性里程计(VIO)的手持行人预测系统,将检测到的人通过射线-平面交点抬升到地面,在重力对齐的度量坐标系中跟踪,并用小型 U-Net 以负对数似然(NLL)损失输出逐步概率热力图。
提出一种三值时序逻辑的概率松弛方法,通过多项式代理网络在同一网络中同时计算数值与梯度,并在真实数据上保留精确判定。该松弛网络可作为梯度控制综合的目标函数,支持离线与在线机器人控制。研究在两个机械臂任务上验证,涉及子任务的中间检查与排序,展示了正确且及时执行的效果。
PermVLA 提出因果锚定置换(CAP),把动作揭示顺序作为 VLA 学习中被忽视的正则化选择,用可调时序前缀采样动作揭示顺序,从同一专家动作块构造条件集增强,无需新增演示数据。
研究者将密度驱动最优控制(D2OC)扩展到离散时间控制仿射非线性系统的多步有限时域控制,通过序列凸规划在每个控制更新时对非线性动力学局部线性化,得到保留 Wasserstein 重心结构并直接纳入输入约束的严格凸二次规划。论文还给出受约束控制偏差与非线性 Taylor 余项下的有限时域误差界及滚动时域两步特化。独轮车与四旋翼团队仿真显示其覆盖性能与非线性模型预测控制相当,同时显著缩短计算时间。
RAGrasp 提出一种检索增强的平面平行夹爪抓取流水线,仅用本地采集的少量带抓取标注 RGB-D 模板即可适配新物体,无需端到端重训练。系统用 DINOv2 视觉特征与外观、深度线索驱动 SAM2 分割查询物体,经两阶段几何-语义检索级联选模板,再由置信度门控选择抓取迁移估计器并做约束细化。真实试验中对已见物体 20/20、未见物体 19/20 抓取成功。
论文提出 Video2World 基准,将自主视频到仿真构建形式化为软件工程任务,包含 222 个重建实例,源自 189 段机器人与人类演示视频,从几何保真度、动态保真度和功能正确性三个维度评测。
研究提出一种确定性分布式算法,解决 n≥3 个不透明自主移动机器人在预算约束移动故障模型下的互见问题,允许任意数量机器人因移动故障永久失能。算法在 SSYNC 模型、非刚性移动、仅共享固定参考点的条件下运行,保证非故障机器人有限时间内互见全部机器人,遵守每个机器人的移动预算并实现无碰撞移动,仅使用 12 种光色。
研究者提出迭代式奖励设计基准 BIRD,将现有 LLM 奖励代码生成与迭代改进方法统一到同一配置与评测空间,便于直接对比、消融设计选择。在 MuJoCo、Meta-World、Assistax、HumanoidBench 上,少量简单设计选择持续提升性能,组合后显著优于先前方法。代码已开源。
SelectOccFlow 提出选择性时空聚合框架,通过 Semantic-Guided Sampling、State-Conditioned Temporal Aggregation 与 Extent-Aware Spatial Aggregation 逐步精炼图像、时序与体素域的上下文证据,用于相机 3D 占据与场景流预测。
研究给出有损编码器下 latent safety filter 安全证书可迁移到物理系统的判据:被丢弃的安全相关动力学的可检测性决定证书是否存在。构造出 latent 模型精确、latent 信号恒报安全而物理状态可任意不安全的系统,此时无证书存在且编码器下游监视器无法检测失效。
CurveCodec 2 用小型学习熵模型对残差做熵编码,整数推理跨平台 bit-exact,并在每段解码片段上验证 ACL 最坏情况或平均误差契约。
该框架将神经网络直觉规划与模型预测控制推理规划结合,通过元认知组件依据知识图谱与风险场在两者间切换。在 CARLA 中针对(应急)车辆闯红灯的分布外场景测试,相比纯神经网络规划器将碰撞数减少 89%,并提升对特殊路权规则的遵守。论文已被 IEEE ITSC 2026 接收。
研究提出用精确二分图完美匹配(Jonker-Volgenant)求解单位质量离散最优传输,在稠密 2-D 实例上比 Sinkhorn 与 Greenkhorn 更快且严格更准:n=500 时 0.01 s、n=8000 时 11.5 s,而 Greenkhorn 达到 1% 质量目标需约 10-80 min(慢 4e2-6e4 倍)。
研究提出一种基于非对称 actor-critic 的循环强化学习策略,用于无人旋翼机在升沉舰船甲板自主降落:训练时 critic 可见 6 s 未来甲板高度,actor 仅接收 17 维机载状态并输出世界系速度与偏航角速率指令。
WAMJET 是一个面向 World Action Models(WAM)推理加速的 agentic harness,通过为编码智能体提供可复用的优化指导以及测量与验证工具,按瓶颈驱动的工作流对推理进行剖析、修改代码、验证效果并迭代优化,同时保持动作质量。
研究者利用流固耦合开发出一类传感端完全不含电子元件的软体触觉传感器,仅用两个外部压力传感器连接充液弹性通道,通过黏性流体位移产生的压力模式编码触碰位置与力。机器学习框架结合特征提取、软聚类与自适应神经模糊推理实现定位与力估计,并在 1D 线性传感器上验证后用空间填充曲线扩展到 2D 触觉映射。该方案在水下或强磁干扰等常规电子传感器易失效的环境中依然有效。
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。