论文提出紧凑操作策略 CoRP,论证细粒度视觉表征的关键作用
论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。
推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。
论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。
推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。
一项研究提出多旋翼推进功率的嵌套建模方法,在气动功率耗散基础上逐步引入可逆动能变化率、与转矩相关的机电耗散和与速度成正比的集中耗散,并在电机-驱动-螺旋桨单元上完成辨识与验证。结果显示,可逆动能变化率对动态功率预测必要但不充分,与电机转矩平方成正比的耗散带来主要改进,速度比例耗散则避免把不可逆损耗误归为可逆动能交换。该方法为多旋翼动态推进功率模型的开发与选型提供了可复用、可实验验证的基础。
ViDAL 提出一种以未来场景视觉动态为锚的连续动作隐空间,通过训练 Action VAE 重建动作块并将隐变量与未来场景动态对齐,可作为即插即用的动作接口兼容多种 VLA 架构。
VLA-ACL 通过动作级监督学习轻量视觉 token 剪枝策略,在完全冻结基座 VLA 模型的前提下,最多剪枝 87.5% 的视觉 token,计算量最多降低 75%,推理加速 1.5x。LIBERO 与真实操作任务实验显示其保持了有竞争力的性能,优于现有冻结 VLA 剪枝方法的性能-效率权衡。代码已开源。
一种查询式代价学习框架为动态可达的自车轨迹查询估计有界代价,用紧凑联合场景 token 捕获多模态 agent 未来,并通过 contingency-aware 代价聚合与 cost-guided intra-cluster MPPI mixing 生成可行自车规划。
iGPC 将 Generative Pretrained Controller(GPC)从通用人体运动扩展到类人机器人与环境的全身交互,通过场景可供性线索与特权状态信息训练交互专家,再由机载传感器观测的学生策略蒸馏接触、抓握与推动技能。实验在多个全身交互任务上验证,大规模生成式人体运动先验可作为类人机器人在接触密集真实环境中学习可部署策略的有效基础。
论文提出 AutodidactWAM,用无需遥操作训练的手部姿态估计加逆运动学从模型生成视频中恢复动作估计,与原生动作配对后仅微调动作相关层。
一项对比研究在统一的Frenet坐标系运动学模型与含再生制动的VT-CPEM能耗模型下,评测了NMPC、PPO、PID-SF和Stanley四种路径跟随控制器。PPO策略在未修改的情况下成功迁移到ISO 3888-1换道、chicane等未见赛道,并零样本迁移到含线性轮胎的动态单车辆模型。NMPC采用JIT编译的CasADi实现以满足实时性要求。
针对受限、遮挡环境下的机械臂探索问题,arXiv 论文提出一种基于 Virtual Model Control 的主动探索方法,通过眼在手上相机与评分方法直接从未探索空间选取目标体素,实现全身反应式避障而无需路径重规划。仿真与真机实验显示,该方法在所有测试环境中均实现超过 90% 的建图覆盖率,耗时低于 120 秒且未与障碍物碰撞。
研究提出基于 Habitat Sionna RT 基准的不确定性感知多模态导航框架,从 RF、视觉与位姿观测历史中联合估计目标方向及其不确定性,在未见场景中相对最强基线将成功率(SR)提升 18.2%、按路径长度加权的成功率(SPL)提升 11.5%。该基准利用场景几何与材质属性生成对齐的视觉和 RF 观测,用于智能工厂巡检中无先验地图、目标被遮挡或光照不佳时的导航研究。
论文提出名为 GOSPAM 的新度量,用于衡量矢量地图在位置误差、存在性与完整性方面的偏差。通过对点要素与折线要素地图的仿真,分析其对偏置、误报、漏报和坐标误差等常见地图退化的敏感性。结果表明 GOSPAM 提供统一且可解释的度量,可作为汽车应用中地图质量评估的候选方案。
GENESIS-Handover 利用 VLM 图像生成产生多种任务特定的手-物交互假设,并实时与观测到的人类手部姿态匹配,以推断最合适的递物配置。在 12 名参与者、5 组任务-物体配对的用户研究中,83.3% 的参与者认为该方法比先前的 state of the art 具有更好的任务理解能力。
IronMan 提出基于信息瓶颈原则的视频-动作学习框架,通过动力学感知瓶颈抑制无关视觉信息、保留动作相关动态线索。在 LIBERO 上达到 99.0% 成功率、RoboTwin clean2clean 上达到 79.4%,均超过所有评测基线。在 OOD 偏移下,LIBERO-Plus 成功率 79.1%,比最强基线高 10.4 个百分点。
论文提出 CA³C(Consequence-Aware Adaptive Action Chunking),一种推理时框架,在不修改或重训练基础策略的前提下,用动作条件世界模型在相同采样噪声下想象多个候选动作块的未来后果,将执行时长估计建模为贝叶斯变点推断问题,并通过未来共识选择执行候选。在多个仿真基准与真实机器人操作任务上,CA³C 使各类动作分块策略的失败率相对降低最高达 71.8%。
SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。
OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。
推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。
PACE 通过将完整演示压缩为有序多模态 prompt token,并用 episode-local fast-weight memory 因果编码已实现的动作-观察转移,缓解长时程操作中的阶段混淆。
MetaMorpher 变形 UAV 采用电机推进与襟翼推进两种相位同步策略实现悬停控制,仿真验证了数学模型与稳定参考跟踪,确认襟翼推进是轻量、解耦的悬停控制替代方案。物理样机的垂直动力学推进模型实验在不同构型下均表现出很好的稳态一致性。论文共 8 页、12 幅图,聚焦悬停模式控制,巡航构型控制已有成熟文献基础。
一项人形机器人全身遥操作研究提出免重定向策略,将原始人体动作在单次前向传播中直接映射为机器人关节指令,消除在线运动学适配带来的时延与物理不可行目标。该方法学习全身运动基元码本,将分布外观测投影到合理运动原型,并从部分输入中恢复全身运动。在 Unitree G1 上结合虚拟现实、光学动作捕捉、文本生成动作与单目视频输入的仿真与硬件实验中,其时延与鲁棒性表现优于基线方法。
CUSP 提出一种模型无关的运行时危险告警方法,从人工干预终止的日志中学习"感知起点"——即人类判断安全驾驶开始转为危险的时刻,用离散时间生存目标训练视觉危险头,再由 CUSUM 累积风险触发告警。
一篇 arXiv 机器人学论文提出将随机技能纳入基于采样的多机器人规划,把问题建模为多模态复合路网上的马尔可夫决策过程(MDP),求解得到反应式策略,使可控机器人能根据其他机器人执行操作技能的情况动态调整自身运动。该方法在规划阶段直接化解技能不确定性,避免保守基线的悲观性,实现稳健的动态多机器人协调,规划器代码已公开。
arXiv 论文提出 Model-Based Geometry-Aware Generative Optimization(2GO),面向四足与人形机器人的 Constrained Locomotion Planning,通过法向诱导度量塑形、切空间随机滤波与 CFS 回缩把主动约束几何转为可执行去噪算子,并以自适应扩散与流式调度解耦生成传输与反向随机性。
StairVLA 提出阶段感知分层动作生成框架,用部分去噪动作作为粗粒度长时程生成与局部精修的接口,高层 VLA 负责早期去噪,轻量 refiner 以更高频率用最新观测精修局部动作块。
CoRE 从多任务、多机器人演示中学习协作-角色专家,让每台机器人仅凭自身视觉观测与本体感觉运行同一策略,无需任务提示、身份标签或机器人间消息,即可在去中心化协作操作中产生互补行为。在仿真基准上,CoRE 取得所评测去中心化方法中的最高平均性能;物理实验验证了其在多种操作任务上的有效协作,以及对协作方延迟与减速的鲁棒性。
一项面向精密装配的研究提出特权噪声蒸馏方法,在 FORGE benchmark 上将 σ=5 mm 位姿噪声下的成功率从基准策略的 32%–60% 提升至 92%–99%,六个非特权基线仅 2%–80%。
ESP(Energy-Score Policy)提出一种免蒸馏方法,用单次网络评估将策略上下文与噪声直接映射为动作块,动作头以 energy score 而非均方误差训练,实现对多模态动作分布的直接学习。仿真与真实操作任务实验显示,其任务成功率与 flow matching 基线相当,而动作生成时延大幅降低。
ExoBridge 框架通过人体肢体耦合,从裸手视频学习映射到穿戴式外骨骼的运动与触觉状态:采集时一只手保持裸露提供视觉观测,另一只手穿戴外骨骼提供同步的运动与触觉测量。
EigenDEXplore 在独立关节空间噪声上叠加沿人体数据特征向量方向的扰动,以结构化探索而非改变动作表示的方式引入相关性,在多种灵巧手上于抓取、手内重定向和接触密集操作任务中持续优于关节空间与学习动作空间基线。实验表明人体运动先验用于结构化探索时最有效,收益覆盖无结构与参考引导 RL、轨迹优化及 sim-to-real 部署,在奖励整形与课程设计较少的设置中提升最大。
SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。
推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。
Silicon Language 提出机器人原生知识交换框架,让机器人把自己的经验编码为知识包发布,经接收端可用性评估、渐进融合与自动回滚后移植到自身传感器与执行器。
NeurIPS 2026 接收的论文提出 OntoPlan,一个基于本体场景表示的智能体框架,用于机器人任务规划。在覆盖 5 个室内环境、3 种场景规模的 150 项通用任务上,OntoPlan 平均任务成功率达 0.89,最强基线仅 0.27;平均每任务消耗 18.1k tokens,约为最高效基线的 1/5.6。场景规模增大时优势保持,且能对模糊或不可行指令追问或报告信息不足。
一项研究提出用受限控制器下的任务能力评估机器人形态,在 EvoGym 三项运动任务中,任务奖励仅能解释该指标 39%、33% 和 10% 的方差,几何描述符也无法预测它。
TacZero 用预训练的通用视觉-语言模型(VLM)解读视觉与触觉观测并直接选择机器人动作,无需额外的触觉或操作训练,也无需针对接触解读与动作选择的任务专用规则。在真实圆柱销插孔实验中,加入数值化三轴触觉输入时 20 次试验成功 15 次,不加触觉输入时仅成功 10 次。该研究为用通用 VLM 做接触密集型操作提供了具体起点,同时指出了这一方向的挑战。
一项面向软体机器人损伤恢复的无先验可复现基准发布,在九次在线试验协议下,GP-EI 参考控制器在两个各含 75 个本体的队列上以 0.235-0.310 的平均最差掩码奖励超越 random search、Sobol、CEM 和 CMA-ES,并在 69/75 个确认本体上取得增益。
论文提出一种从未分割点云中学习抓取目标的策略,用于液压林业起重机的原木清堆作业,策略在观测点上分类抓取位置并预测深度与抓斗姿态,同一网络支持行为克隆、强化学习和部署。
一篇 arXiv 论文提出在世界模型(WM)隐空间中建模隐空间扰动,通过动力学感知相似度度量与分布外检测构建合理隐动力学集合,并用 conformal prediction 校准不确定性集合,再以博弈论优化联合求解鲁棒机器人动作与最坏情况扰动。
论文提出 GaugeBench,把固定机器人改写为物理等价的描述并评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅 51.6,而 98 个真正未见机器人仍有 1489.6。
推荐理由:论文用等价改写描述的对照实验,量化了跨本体评测中被忽略的表示脆弱性,可迁移方法在于其隔离思路。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
OpenSplatGraph 提出一个统一框架,直接从在线 Gaussian 开放词汇语义地图构建持久化 3D 场景图,通过可靠性感知语义场实现置信度感知、查询条件化的对象提取,并将对象实例关联到持久图节点以增量更新属性与关系。该框架在标准 3D 场景理解基准和真实机器人实验中取得有竞争力的在线开放词汇感知与下游任务性能,已被 ACCV 2026 接收。
论文提出即插即用的物理引导视觉提示(PG-VP)模块,通过在冻结的 VLA 模型输入上叠加随帧移动的虚拟障碍物,使导航策略绕开辐射与温度等不可见危险,无需重新训练。