RVC-NMPC:基于互易速度约束的非线性模型预测控制实现敏捷 UAV 飞行中的互碰撞规避
RVC-NMPC 将时变互易速度约束(RVC)直接集成进非线性模型预测控制(NMPC)问题,仅依赖对其他机器人的可观测信息即可实现 UAV 互碰撞规避,整条流水线运行在 100 Hz。仿真覆盖最多 10 架 UAV、速度达 25 m/s,实飞实验加速度达 30 m/s²。与现有方法相比,该方法在挑战性场景中飞行时间缩短 31%,所有试验均保持无碰撞导航。
RVC-NMPC 将时变互易速度约束(RVC)直接集成进非线性模型预测控制(NMPC)问题,仅依赖对其他机器人的可观测信息即可实现 UAV 互碰撞规避,整条流水线运行在 100 Hz。仿真覆盖最多 10 架 UAV、速度达 25 m/s,实飞实验加速度达 30 m/s²。与现有方法相比,该方法在挑战性场景中飞行时间缩短 31%,所有试验均保持无碰撞导航。
提出最小限制超平面控制障碍函数(Least Restrictive Hyperplane CBFs),通过优化支撑超平面朝向降低保守性,使安全控制更接近期望控制。该方法将常见基于距离的 CBF 视为 H-CBF 的特例,在带加速度约束的双积分器系统上穿越任意形状的静态与动态障碍群进行验证。结果显示,期望控制与安全控制之间的平均差距缩小一个数量级。
Po-Chen Ko 等人提出 RELIC,一种面向机器人操作的视频重规划框架,通过优化捕捉环境隐藏物理属性的潜变量嵌入,并用基于拒绝的采样过滤与既往失败不一致的假设,从而在测试时失败中适应推门还是拉门、摩擦等只能靠试错揭示的属性。
ZeST 将重复的 VLM 输出作为随机测量并融合为不确定性感知后验,实现零样本可通行性预测,避免机器人进入危险环境采集真实数据。在受控室内与非结构化室外环境中,ZeST 以最高 4s 推理延迟取得 90-100% 导航成功率,持续抵达最终目标,优于其他先进方法。
一篇综述分析物理仿真器如何缩小机器人导航与操作任务的 sim-to-real 差距,考察以往综述较少关注的仿真器属性、任务特性与硬件需求。文章还整理了基准数据集、评测指标、仿真平台与方法资源,帮助研究者在硬件约束下选择合适工具。该综述共 35 页、9 幅图,已被 ACM Computing Surveys (CSUR) 接收。
研究提出用伪触觉作为反馈消除抓取操作任务中的夹爪状态歧义,使模仿学习策略可完全在仿真中训练。该方法受力控夹爪充当触觉传感器的思路启发,为策略提供无噪声的二值夹爪状态观测,无需额外数据采集或硬件改动。三项真实抓取任务实验验证了其必要性、有效性与高效性,成果已被 IROS 2025 接收。
提出一种基于 Dirichlet Process Mixture 的贝叶斯非参数技能先验,在结构化隐空间中建模时序扩展技能,无需预设成分数即可自适应发现技能,并嵌入分层强化学习框架指导高层技能选择。
DAHLIA 提出一种数据无关的代码生成框架,将长程操作任务建模为回合式任务规划与评估,用渐进组织的上下文示例和 chain-of-thought 推理引导 LLM 合成可执行代码计划。
研究提出一种将现有基于反馈的运动学运动规划器适配到二阶自主系统的方法,同时保留其安全性与几乎全局渐近稳定性保证。方法覆盖两类运动学运动规划器:基于导航函数推导的规划器,以及直接通过期望速度场定义、不依赖底层导航函数的规划器。两个基于反馈的运动学运动规划器被适配到二阶系统,并在仿真与实验中得到验证。
该研究提出一种面向实时自动驾驶的遮挡感知应急安全关键规划方法,用幻影车辆的前向可达集推导风险感知动态速度边界,并以时空屏障约束写入双凸非线性规划,同时优化探索与回退轨迹。基于共识 ADMM 将问题分解为低维凸子问题以实现实时求解。仿真与遮挡路口实车实验验证了安全性与通行效率提升。
研究提出让机器人逐条主动索取运动学示教的方法,用螺旋几何表示从示教生成操作规划并使示教充分性可度量,结合基于 PAC-learning 的多臂老虎机采样策略评估任务空间子区域的规划能力,并用启发式从薄弱区域追加示教。22 名无机器人背景参与者在倒水和舀取两项任务上的用户研究表明,少于 10 条示教即可教会机器人规划任务。成果发表于 2026 IEEE ICRA。
TAPDreamer 提出一种仅依赖公开编码器、无需查询目标策略的世界动作模型对抗攻击,用单个冻结补丁(约占输入 6.5%)将 FastWAM 在 40 个 LIBERO 任务上的成功率从 97.7% 降至 0.0%,在 50 个 RoboTwin 任务上从 90.8% 降至 0.0%,而匹配的随机补丁仍保留 81.5% 和 79.2%。
Wancong Zhang 等人提出 H-JEPA,一种端到端训练分层 action-conditioned JEPA 的方法,各层在自己的潜空间中预测更远的未来,规划自顶向下逐层生成子目标。
研究者为 CADENCE 算法提出两种学习型角落选择启发式方法——基于网格编码的 CNN 评分器与在可见性图上用 Deep Q-Learning(DQN)训练的 GATv2 网络——在保留形式化覆盖与连通性保证的同时提升部署效率。
RealtimeWAM 提出一步动作生成与异步推理的 World Action Model,针对动作专家内部多步去噪和视频与动作专家串行等待两个瓶颈。
推荐理由:论文用一致性蒸馏加跨专家流水线压缩 WAM 推理,给出的加速比和精度损失数据可为实时机器人策略选型提供参考。
KineWorld 提出传输感知世界建模框架,把机器人运动学从动作条件扩展到生成监督的空间分配,通过 Kinematic Transport Lifting(KTL)构建渲染器派生、相机对齐的传输场,并用 Transport-Aware World Diffusion(TAWD)在视频潜空间网格上校准运动支撑、重加权未来 RGB 流匹配。
CentriQ 是一种免校准的 Diffusion Transformer(DiT)量化方法,通过在旋转前对每个 token 做均值中心化,并用 rank-1 全精度分支精确还原均值,使 per-token scale 可闭式求解。
EpicWorldModel 用 flow-matching 目标训练随机 JEPA,在部分可观测、存在遮挡的环境中直接预测多个潜在未来状态,并以 flow 预测方差作为探索信号融入 CEM 规划。隐空间规划实验中该方法在各任务上取得最佳或持平表现,成功率较 LeWorldModel 最高提升 22%。论文已被 NeurIPS 2026 接收。
RADPO 提出一种免模型的扩散策略优化方法,将预测首达安全估计与累积成本预算反馈结合,用于安全感知的连续控制强化学习。该方法学习折扣首达可达性值来塑造奖励,并用对偶式乘子按实际回合成本相对预算调整塑形强度,无需学习动力学模型、动作梯度或反向扩散采样器求导。在十项连续控制安全任务上,RADPO 取得有竞争力的奖励-成本权衡,多个任务的约束违反显著低于对比基线。
该研究首次给出未知输入驱动的非线性系统状态估计的通用结构解,提出 UID 诱导正规形,将未知输入信息分解为与可观测动力学结构解耦的方向和完全表征其影响的可观测量,无需对未知输入作模型或随机假设即可统一实现解耦与重构。在最小 Structure-from-Motion 配置中,仅用 3 个点特征和单轴陀螺仪即可递归估计状态,恢复三维结构与相机运动(差一个未知全局尺度因子),真实数据实验验证了可行性。
论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。
推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。
提出可控道路标线生成方法,从可行驶区域掩码、外环标线与文本描述合成缺失的中心区域标线布局,输出车道分隔线、道路分隔线与人行横道三类通道。系统采用文本条件 BEV 潜空间 rectified-flow DiT,配合拓扑感知辅助损失与免训练的 Structured Gaussian Render 后处理。
论文提出 PIVOT-Q,一种面向脆弱状态的 On-Policy Distillation 框架,用冻结的全精度策略作教师,选择性纠正量化学生策略 rollout 中的脆弱状态。
StageVLN 提出一种训练框架,用冻结的几何基础模型提供多级空间引导,并以相对朝向与专家路线进度目标补充轨迹状态监督,辅助组件仅在训练期使用、部署时移除。在 R2R-CE validation-unseen 上,StageVLN 以 4B 参数骨干取得 56.3% SR 与 51.4% SPL,推理阶段无需额外几何编码器;在 RxR-CE 上取得 54.3% SR,且不引入额外导航训练数据。
该框架将复合场景分解为原始场景、将规范分解为子规范,独立验证每个原始场景后用重要性采样与核密度估计组合统计估计,用于安全与 co-safety 规范的高效分析。实验评估显示,它能准确回答此前未见复合场景的验证查询,并通过并行化与轨迹复用降低仿真成本。该工作为 RV 2026 论文的扩展版本。
提出 VPGGT(Vision-Prior Geometry Grounded Transformer),一个基于 VGGT、扩展 OmniVGGT 的先验感知具身感知框架,用于处理含噪相机位姿并恢复物理尺度。
SAPrune 是一种免训练的视觉 token 剪枝框架,用小型校准集观察动作-视觉注意力随层的变化,在注意力模式更可靠后再选择剪枝层,并在每个选定层采用双路径规则保护高注意力 token 与有用上下文。
VICS-G 通过可行未来解码在冻结的视觉-语言-动作(VLA)策略上重排候选动作,在 Safety-CHORES 的六项设置中将平均累计安全成本降低 1.9%-57.5%,成功率与策略采样相比保持在 2.5 个百分点以内,平均回合长度相差 0.82 步。该方法以报警触发、免训练的重排器形式实现,无需重训基础策略,也无需在线轨迹 rollout。
提出方向条件策略(DCP),在对比强化学习(CRL)基础上让策略以表征空间中路点的方向与距离为条件,部署时直接作用于最终目标,无需路点选择或规划。在九项导航与操作任务中,DCP 有七项取得高于 CRL 的最终成功率,七项在目标附近停留更久;受控迷宫实验显示其更准确捕捉最短路径几何。研究指出路点覆盖与排序限制探索,学习式候选生成在两个受控迷宫中提升目标到达率。
一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。
推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。
GeoBridge-VLA 提出一种两阶段方法,从预训练 VLA 的冻结视觉编码器中学习几何特征用于动作预测,Stage I 训练 feature bridge 与 geometry decoder 并用深度监督,Stage II 冻结这些模块后训练门控残差接口与动作侧投影及 action expert。
LightVLN 提出轻量化历史感知空中视觉语言导航框架,用 0.5B 语言骨干配合紧凑历史与当前观测表示,将当前观测从 256 个视觉 token 压缩到 32 个,最多 16 帧历史下策略仅用 48 个观测 token。
研究将 Level-K 策略库的部署问题建模为部分可观测马尔可夫博弈中的动态编排,比较基于分类的编排器(CBO,使用离线数据或 on-policy 数据聚合训练)与强化学习编排器(RLBO)。在追逃实验中,on-policy 训练提升分类与回报,但 RLBO 回报高于 on-policy 与离线 CBO。给定预训练策略库,RLBO 以更少训练步数达到与直接在追逃者动作空间上训练的策略相当的性能。
研究者构建并评估了一套仅用单目相机与视觉惯性里程计(VIO)的手持行人预测系统,将检测到的人通过射线-平面交点抬升到地面,在重力对齐的度量坐标系中跟踪,并用小型 U-Net 以负对数似然(NLL)损失输出逐步概率热力图。
提出一种三值时序逻辑的概率松弛方法,通过多项式代理网络在同一网络中同时计算数值与梯度,并在真实数据上保留精确判定。该松弛网络可作为梯度控制综合的目标函数,支持离线与在线机器人控制。研究在两个机械臂任务上验证,涉及子任务的中间检查与排序,展示了正确且及时执行的效果。
PermVLA 提出因果锚定置换(CAP),把动作揭示顺序作为 VLA 学习中被忽视的正则化选择,用可调时序前缀采样动作揭示顺序,从同一专家动作块构造条件集增强,无需新增演示数据。
研究者将密度驱动最优控制(D2OC)扩展到离散时间控制仿射非线性系统的多步有限时域控制,通过序列凸规划在每个控制更新时对非线性动力学局部线性化,得到保留 Wasserstein 重心结构并直接纳入输入约束的严格凸二次规划。论文还给出受约束控制偏差与非线性 Taylor 余项下的有限时域误差界及滚动时域两步特化。独轮车与四旋翼团队仿真显示其覆盖性能与非线性模型预测控制相当,同时显著缩短计算时间。
RAGrasp 提出一种检索增强的平面平行夹爪抓取流水线,仅用本地采集的少量带抓取标注 RGB-D 模板即可适配新物体,无需端到端重训练。系统用 DINOv2 视觉特征与外观、深度线索驱动 SAM2 分割查询物体,经两阶段几何-语义检索级联选模板,再由置信度门控选择抓取迁移估计器并做约束细化。真实试验中对已见物体 20/20、未见物体 19/20 抓取成功。
论文提出 Video2World 基准,将自主视频到仿真构建形式化为软件工程任务,包含 222 个重建实例,源自 189 段机器人与人类演示视频,从几何保真度、动态保真度和功能正确性三个维度评测。
研究提出一种确定性分布式算法,解决 n≥3 个不透明自主移动机器人在预算约束移动故障模型下的互见问题,允许任意数量机器人因移动故障永久失能。算法在 SSYNC 模型、非刚性移动、仅共享固定参考点的条件下运行,保证非故障机器人有限时间内互见全部机器人,遵守每个机器人的移动预算并实现无碰撞移动,仅使用 12 种光色。