OptCar:将通才 FKD 模型特化为跨地形高速 MPC 控制
论文提出 OptCar,一种把通才前向运动学动力学(FKD)模型特化为特定车辆高速模型预测控制(MPC)的方法,用 FiLM 将多步预测条件化在单个动力学上下文 token 上,并结合少量真实数据与环境系统辨识的合成 rollout 进行特化。
论文提出 OptCar,一种把通才前向运动学动力学(FKD)模型特化为特定车辆高速模型预测控制(MPC)的方法,用 FiLM 将多步预测条件化在单个动力学上下文 token 上,并结合少量真实数据与环境系统辨识的合成 rollout 进行特化。
论文提出 VIA(Visual Interface Agent)框架,把机器人控制重新表述为智能体任务,让现成智能体通过由可交互视觉组件构成的虚拟工作区直接驱动机械臂,用鼠标式工具探测像素并指挥虚拟末端执行器设定目标位姿。
CoRL 2026 收录论文提出 Failure-Aware Retry(FAR)框架,让机器人在测试时从既往失败中学习并自主完成任务,避免朴素重试重复同样的错误。
论文提出 MultiSensory World Model(MuSe),通过多阶段融合、多感官未来预测和在预训练数据上的经验回放,把有限的多感官数据注入仅视觉的预训练策略,使其适应新任务并引入新模态,同时保持原有传感器配置下的性能。
SurGE 是一个腿足机器人协同设计框架,通过 Kino-SRB 模型与设计感知控制策略构成的可微管线计算设计目标的代理梯度,并以均值偏移加余弦退火步长衰减注入 CMA-ES。
ED3R 提出一种能量感知的分布式野火检测框架,通过机器人与远程控制器的分层协同决策,在满足置信度要求的同时最小化能耗。该框架集成避障、冗余探索规避与基于分布式神经回归模型的前瞻能力,任务成功率最高达 97.18%。在最严苛任务中,相比基线方法能耗降低最多 36.4%,野火检测速度提升最多 41%。
论文提出 SAPS,一个在动作层将实时人类遥操作指令与预训练 VLA 动作融合的轻量框架,无需重训策略、辅助动力学模型或架构改动。
论文提出针对机器人学习管线中世界模型的新型数据投毒攻击,可在看似安全的遥操作数据集中注入恶意提示或被破坏的转移动力学,仅在经世界模型输入后激活,进而生成危险的合成训练轨迹并导致不安全的机器人策略部署。作者在动作条件和文本条件世界模型上验证了攻击效果,展示了针对下游 DRL 策略的端到端后门以及 VLA 场景的概念验证,呼吁研究更安全的世界模型并重新评估其在机器人学习供应链中的位置。
WorldDP 提出一种面向多阶段机器人操作任务的分层世界模型框架,高层世界模型作为转移函数在运行时优化可行子目标,再由低层 Diffusion Policy 执行到达。框架引入以物体为中心的表征,将环境实体解耦以支持逐实体的顺序规划。在多个机器人基准测试上,WorldDP 持续优于现有基线,验证了世界模型的物理规划与 Diffusion Policy 高效执行相结合的多阶段性能优势。
论文提出把 ROS bag 到机器学习数据集的构建过程建模为基于依赖图的产物构建流程,并实现为开源 Bazel 扩展 Bagzel,支持可复现的增量数据集生成与 nuScenes 格式导出。
论文指出多目标机器人任务的失败多源于静态目标表示而非任务复杂度,为此在 AICON 图结构上扩展自适应零空间投影:低优先级梯度在相遇处进入高优先级梯度的零空间,按当前梯度幅值排序而非固定层级;当两梯度对立且任何加权都无法前进时,系统在较强者的零空间中探索直至冲突消解。
论文提出 Dynamic Neural Koopman(DNK)蒸馏框架,把多步扩散推理压缩为以观测和采样噪声为条件的单次前向,并引入 Factorized Dynamic Koopman(FDK)层,用潜空间中的条件相关特征值线性算子建模去噪过程。
一篇被 Robotics and Automation Letters (RA-L) 接收的论文为平滑隐式接触动力学提出安全滤波框架,通过一阶 Taylor 近似推导离散时间控制障碍函数(CBF)约束,并引入边界聚焦 rollout 筛选平滑参数 κ、以固定裕度收紧预测约束。四个接触丰富系统的仿真表明,该方法消除了标准 CBF 下观测到的力约束违反。
TAVIS 是面向主动视觉模仿学习的评测基础设施,包含 TAVIS-Head(5 个任务,通过 pan/tilt 颈部全局搜索)与 TAVIS-Hands(3 个任务,腕部相机局部遮挡)两套任务,基于 IsaacLab 构建,覆盖 GR1T2、Reachy2 两种人形躯干具身。
TriDeliver 提出首个分层协同框架,将人类快递员、UAV 与众包地面车辆(GVs)整合用于即时配送,并设计基于 Transfer Learning(TL)的算法从快递员行为历史中提取知识、迁移至 UAV 与 GVs。
NovaPlan 是一个分层框架,通过系统性地提出、验证和修复视觉计划,实现鲁棒的零样本长时域操作。高层由 VLM 规划器分解任务,并通过验证多个候选视频回滚过滤动力学不一致的未来;执行中采用在物体中心流与人手流之间自适应切换的混合几何表示,并持续监控执行、在失败时合成指尖轻戳等局部非抓取纠正行为。
RoboPilot 提出一种双思考闭环 agentic 框架,用于动态真实环境中的机器人操作,通过反馈机制根据环境变化和执行错误进行重规划,并在快慢思考间动态切换以平衡效率与精度。
论文提出机器人策略框架 Agentic Scene Policies(ASP),通过 scene-agent 工具接口把物体定位能力与机器人技能统一到单一 agentic 动作空间,缓解模块化策略仅按语义检索、缺乏显式空间推理的局限。
论文提出 LYRA,一个人类引导的终身技能学习与代码生成框架,将人类反馈蒸馏为模块化可复用技能,并在外部记忆中存储技能与执行示例,借助检索增强生成和用户提示支持超长时程任务执行。
RoboFAC 提出一个面向 VLA 模型失败诊断与恢复的框架,构建了含 9,440 条错误操作轨迹、78,623 个 QA 对、覆盖 53 个仿真与真实场景的失败数据集,并训练出可本地部署的轻量多模态模型。实验显示其失败分析准确率比 GPT-4o 高 34.1%,作为外部监督器接入真实 VLA 控制流程后在四项任务上带来 29.1% 的相对提升,且延迟显著低于 GPT-4o;模型与数据集已公开。
论文提出 Ledger,一种从第一人称视频构建的持久 3D 物体记忆,结合物体位置、历史与上下文描述,可在物体离开视野后仍保留记录并回答空间问题。
论文提出基于 JEPA 的机器人世界模型 RoboJEPA,在覆盖 12 种机器人本体的大规模真实机器人数据集上训练,其想象误差(latent rollout 误差)随算力呈二阶幂律,可在拟合规模之外预测模型质量。
推荐理由:论文给出想象误差随算力的二阶幂律,为评估多本体世界模型规模提供了可迁移的预测方法。
论文提出 contextual object placement 基准任务,即在观察到的携物过程中预测物体的目的地,并发布配套数据集 ECHO。
论文提出 Q-learning with Scalar Adjoint Matching(SQAM),针对流策略经多步流生成动作、用离线 RL 微调时每步需向量-雅可比乘积且成本随流步数与策略规模增长的问题,观察到预训练流策略的批量平均速度雅可比集中在对角线上,据此推导出按流时间缩放最终动作价值梯度的闭式标量伴随,消除逐步向量-雅可比乘积,并在策略生成动作上加入价值惩罚。
论文提出 Rubix,在平方欧氏损失下全局求解等权平面点集对齐问题,无需给定对应关系。每个匹配对应一个复相关,其凸包构成排列多边形,最远顶点给出全局对齐;作者证明 n≥2 时顶点数紧界为 n(n-1),回答了 Rote 的旋转分配公开问题,精确算术下以 O(n^5) 次操作恢复该多边形。
研究提出"时间可解释性"概念,通过动作分块(action chunking)改进可微决策树(DDT)在序贯决策任务中的表现,并给出两种融入动作分块的策略梯度算法与一种信息论树重构算法。在四个仿真环境中,从蒸馏的动作分块策略热启动得到的 DDT 效果最佳:在四个领域中的三个上匹配神经网络策略的性能,参数量最多减少 80%。代码已开源。
论文提出 Video Prediction Policy 2(VPP2),一种世界动作模型(WAM),通过大规模操作视频继续预训练、蒸馏为单步视觉规划器,并以 mixture-of-transformers(MoT)架构引入动作模块,实现视频预测与动作生成的零样本泛化。
NeurIPS 2026 主会(Poster)接收的论文提出 MoSDOT(Mode-Support Semi-Discrete Optimal Transport),在教师训练前用条件半离散最优传输把每个噪声样本指派到单一协调模式,修复标准 flow-based 教师将噪声与回放目标独立配对导致的模式间错误采样。
一项针对人机协作(HRC)中 RLHF 的范围综述筛选 199 条记录并纳入 20 篇 2020-2025 年同行评审文献,作者称其为首个聚焦 RLHF 双向闭环设计的综述。随后开展的 VR 被试间实验用贝叶斯模型分析系统发起与用户发起反馈对机器人近端行为安全导航的影响,结果显示用户发起反馈能更好地捕捉感知安全,表明反馈时机直接影响反馈质量。
UltraWorld 提出一种自蒸馏方法,可在没有真实动作标注的情况下,把临床超声视频中的先验迁移到可交互世界模型。
研究提出离线强化学习框架 Interaction-Constrained Drive Policy(ICDP),显式控制自动驾驶中的交互分布偏移(IDS),将联合支持退化精确分解为自车支持分量与残余交互支持分量,并通过对比密度比估计恢复后者,无需显式联合密度建模、周围智能体预测或在反应式仿真器中 rollout。
论文提出 MeshSIPP,一种面向动态环境下非完整约束轨迹规划的高效算法,通过将运动原语作为空间束传播、用轻量包围区间检查筛选,并把昂贵的精确出发时间搜索推迟到原语到达终态时,来消除计算瓶颈;另加时间感知剪枝规则提前丢弃冗余时空分支。作者证明该搜索具备完备性与最优性,在超过 6,000 个基准实例和 ROS 2 实时仿真中,MeshSIPP 相比最先进的时空规划器最高获得 3× 加速。
论文提出情境条件化思考记忆框架,将历史推理经验转化为预测当前情境应思考内容的轻量策略,把详细推理留给大语言模型。实验显示该策略在时间规则泛化上达到 1.000 F1,将 DeepSeek 推理 F1 从 0.789 提升至 0.868,在 30,000 条历史情境下把单次查询在线处理时间从 0.3636 ms 降至 0.0382 ms。
WAPR 是一个零样本广角 6D 位姿精修模型,可对旋转偏差最大达 90 度的候选位姿进行精修,每个检测实例仅需 12 个候选位姿,单帧推理在 1 s 内完成,位姿估计吞吐量最高达每秒 25 个检测实例。
ActiveLang 提出一种主动开放词汇 3D 地图构建系统,通过语义不确定性引导探索,在紧凑的双 Gaussian 表示上在线适配语言特征,联合重建场景几何、外观与开放词汇语义,内存开销较小。其规划器高效选取信息量高的视点,用更少观测和更低计算成本完成建图。在 Replica 和 ScanNet++ 上的实验显示,其 2D 与 3D 开放词汇分割效果相比在线与离线基线均有明显提升。
TERRA 用紧凑的时序效果(净特征变化加窗口内低阶动力学分量)描述状态转移,并提出 Effect-Anchored Transport(EAT),让潜在动作在其他初始状态下解码后锚定到源端观察到的效果,使其含义由跨上下文的作用而非单一转移决定。
论文提出 DSReg(Dependency-Sparsity Regularization),在 Structural Diversity 条件下证明可在无重建、无解码器、无标签的情况下,将单个世界隐变量恢复到符号置换意义下。
RLHND 提出基于视频基础模型的手部跟踪模型,从单目第一视角视频联合估计手部位姿与贴近实际的触觉信息,缓解现有方法仅从裁剪帧回归位姿导致的不准确和物理不一致问题。
论文提出一种事件对齐的视觉动作推理框架,围绕交互事件组织视觉-动作预测,让 WAM 在每次想象推演中生成事件对齐的视觉上下文,对任务关键状态变化给予更细粒度的推理,对连接性过渡则粗粒度推进。
论文提出面向物理 AI 数据策展的通用工具 Kuration SDK,并随论文开源。作者在 CounterStrike 游戏数据上训练和评估扩散世界模型,确认可玩性与 FVD、LPIPS、JEDi 等指标并不对应,将其称为 Virtual2Real gap;Kuration SDK 帮助定位了两个 LPIPS 和 FVD 分数接近、但实际表现差异很大的世界模型的根因。