LiSoNav-Eval:面向物体布局变化的终身小物体导航基准与 IVAM-Nav 方法
论文提出 LiSoNav-COL 任务,要求机器人在空场景记忆起步、持续寻找被移动的小物体,并发布覆盖 28 个室内场景、45 类小物体的基准 LiSoNav-Eval,其导航序列包含未变动与已重定位目标以评测记忆复用与适应能力。同时提出基于多视角观察与视角锚定记忆的导航方法 IVAM-Nav,实验显示其优于代表性方法;基准分析表明物体越小、环境越大、重定位距离越长挑战越大,数据集与代码已公开。
论文提出 LiSoNav-COL 任务,要求机器人在空场景记忆起步、持续寻找被移动的小物体,并发布覆盖 28 个室内场景、45 类小物体的基准 LiSoNav-Eval,其导航序列包含未变动与已重定位目标以评测记忆复用与适应能力。同时提出基于多视角观察与视角锚定记忆的导航方法 IVAM-Nav,实验显示其优于代表性方法;基准分析表明物体越小、环境越大、重定位距离越长挑战越大,数据集与代码已公开。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
一篇 arXiv cs.RO 论文提出基于 Model Predictive Control (MPC) 的分布式控制器,用于高效执行基于 braid 的拓扑约束。
Video-to-Model 框架可从输入视频自动建模可变形缝合线的运动:感知模块定位并跟踪缝合线,时空 CNN 网络估计结构化 CBF-CLF-QP 模型的有效参数,再在用户定义的针头速度输入下仿真缝合线。在未见过的缝合线构型与运动上的实验表明,该框架能可靠重建缝合线行为、自动配置模型并以低跟踪误差复现预期运动,减少手动调参需求。
研究团队构建了配备人工肌肉、多模态传感器和强化学习训练的神经网络控制器的机器人运动系统类比模型,实现了精准运动与损伤鲁棒性,并复现出类似动物的神经群体动力学。研究发现神经旋转会产生垂直于抓取方向的振荡机动以优化轨迹调整,该结论经灵长类神经数据验证,同时揭示了传感器与运动冗余下的反直觉神经能量原则。
论文提出一套视觉系统,由带臂载相机的四足机器人对 nano-UAV 进行定位:四足跟踪无人机,用分割掩码与深度估计其在自身坐标系中的位置,并通过实时无线电链路发送。
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
论文提出 MILD 操作接口定位数据集与 AprilVINS 定位方法,用于 UMI 式机器人操作示教中的末端执行器定位。MILD 真实子集包含 Insta360 X5 与 Insight9 采集的 86 段传感器序列、15 项重复桌面任务及每次执行的机器人末端参考轨迹,仿真子集 MILD-Sim 在 Isaac Sim 中扩展任务覆盖。
论文提出一种紧凑型移动机器人,用折纸结构轮实现移动并主动调节传感几何:轮子在地形自适应构型间切换时底盘俯仰带动 2D LiDAR 扫过不同高度,IMU 提供姿态,融合节点将 LiDAR 点云投影进 RTAB-Map 的 RGB-D 深度流。
研究提出一种端到端方法,仅输入网格装配体即可自动生成逐步装配手册或结构化失败报告,无需关节元数据或紧固件标注。该方法自主完成装配工具清单、装配顺序与子装配、装配手册及可装配性设计反馈四项内容,其中顺序规划通过在物理仿真器中系统性拆解物体并应用编码DfA原则的成本函数实现。
论文提出一套端到端自主流水线,用于定制木质装配体的设计与物理构建,生成式 AI 代理将用户提示转为初始 3D 几何,并通过图注意力网络代理的梯度修复阶段反向传播调整组件几何。该方法在 60 条新颖自然语言输入上使机器人拧螺丝成功率达 86.7%,显著优于先前工作十倍,并用两台 UR5e 机器人对其中十个结构完成了物理可装配性演示。
AeroEval 是一个代理辅助中间件,对 LLM 生成的无人机任务做分阶段校验,先验证程序语法、平台 API 用法与任务意图,再结合执行轨迹、任务需求和环境上下文评估实际行为,每阶段返回结构化失败信息用于迭代重生成。
论文提出 ΔWAM,通过动作切线场(Action Tangent Fields)对动作如何诱导未来动力学变化做局部 Taylor 展开,把世界监督重新表述为与动作紧密耦合的一阶结构,并蒸馏进 WAM 的去噪监督。
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。
论文提出 RoboPace,一个面向动作块策略的在线重定时层,在保留策略几何路径的前提下按预测接触调整执行速度,同时兼顾接触相关速度限制与机器人运动学、动力学约束,无需重训练策略即可实时运行。在双臂机器人的三个接触丰富任务上,快速均匀执行和仅按物理限速的重定时大多失败,而 RoboPace 的整体成功率高于慢速均匀执行,并在约一半时间内完成五条指令中的四条。
一项研究提出面向腱驱动机械臂的多目标优化方法,用 NSGA-II 同时最大化关节扭矩并最小化臂厚,优化肌腱走线、滑轮配置与附着点。结果得到 Pareto 最优设计,通过策略性捷径有效扩大等效力臂,为紧凑高扭矩机械臂提供设计指南,其优化构型呈现超出常规设计直觉的非平凡规律。该论文已被 Advanced Robotics 接收。
一项基于 MixVPR 视觉地点识别的示教-重复导航系统在真实场景测试中实现室内外运行,鲁棒性与导航精度达到其他先进系统水平,同时硬件需求更低,适用于更广泛的机器人平台。该工作为 2025 European Conference on Mobile Robots (ECMR) 论文,共 6 页、5 幅图。
一项研究提出面向机器人控制的自适应代码生成架构框架,采用双 AI 设计:LLM 将高层意图翻译为限定在形式化机器人库内的可执行程序代码,VLM 通过蒸馏过程提供语义锚定。框架引入基于几何与语义阈值的环境驱动重规划触发机制,配合持续运行时监控与自适应规划循环。在前沿模型上的基准测试表明,将生成式 AI 置于响应式受限循环中,可在动态未知环境下稳健完成复杂意图。
该论文研究可变形线状物体(绳)的单次挥击操作,目标同时指定绳尖 3D 位置与到达方向。作者将 DeformX 仿真器扩展为 DeformX2.0,加入 GPU 加速、稳定的 Cosserat 杆求解器和横流气动模型,速度提升超过 $20{,}000\times$;并提出 TRACE 生成挥击数据训练条件流匹配策略,仿真准确率达 92.1%。
论文提出 Targeted Modality Dropout(TMD),通过注意力估计各模态依赖度并选择性丢弃最主导模态,配合依赖分布的熵正则化,提升多模态模仿学习策略的鲁棒性。
论文提出 FACE,一个接触因素分解的模仿学习框架,将任务意图与环境相关的接触因素分离。其表示在归一化的接触相对坐标中表达交互力,并通过学习的接触法线估计器与在线摩擦估计器推断局部接触法线和有效摩擦尺度,从而在执行中把力观测编码、把策略输出解码为运动与力指令,无需更新策略参数即可适配当前接触条件。
论文提出 SOUL(Sparse feature pOlicy UnLearning),针对 VLA 模型反复出现的状态幻觉问题,选择性遗忘与幻觉行为相关的策略知识,其中幻觉失败与成功行为对应的稀疏特征分别作为遗忘和保留目标。
论文介绍 SiGNgapore 数据集,用手持设备在新加坡多处公共场所采集,聚焦以导航标志为核心的无地图导航决策。数据包含 RGB、稀疏深度、里程计与 IMU 测量,提供 56 个长程导航任务和超过 450 个标志中心场景,附带可读格式数据、转换为 ROS 2 的工具脚本、场地地图以及与 GPS 对齐的场景图。
论文提出 ResGAC,一种结合几何导纳控制(GAC)与残差强化学习的人形机器人全身控制器,用于在浮动基座振荡、重力与运动干扰下实现精确的 SE(3) 末端执行器位姿跟踪。
论文提出 RobotAPO,一个在连续 flow-matching 去噪空间中运行的对抗式物理偏好优化框架,用于机器人操作视频生成,并发布 AgiBot-PhysPref 数据集,含 10,000 条隔离条件匹配物理违例的偏好样本。
TempoBridge 是一个轻量框架,利用冻结的 VLA 表征按指令中的节奏线索在各任务阶段调制动作,无需额外的节奏条件机器人演示或针对节奏的基策略微调。它从上下文 VLM 表征中提取节奏线索,通过因果阶段路由与任务进度对齐,并在执行中调制标称运动指令。
论文提出 Immiscible Diffusion Policy,一种免标签的训练期附加方法,通过动作-噪声分配保持相对独立的噪声到动作路径,不改动策略架构与推理流程,以缓解扩散策略坍缩到单一模态的问题。
COOL 是一个机器人框架,能从日常观察中自主学习物体归属关系并维护长期空间记忆,已获 CoRL 2026 接收。它采用基于智能体的 curiosity-driven 数据采集策略,引导机器人前往最有价值的地点获取信息并刷新过期观测。离线实验、消融研究与真实场景评测表明,COOL 能从真实人机交互中推断归属关系,并据此完成归属条件下的导航与任务执行。
论文提出约束学习框架 Counterfactual KKT(CF-KKT),利用局部学习的可微动力学模型对演示施加 KKT 最优性条件,并生成奖励提升的反事实行为合成不可行数据,从而在无需已知动力学和额外危险探索的情况下恢复未知约束。
ClimbLab 是一个开源的 MATLAB 仿真与分析平台,专为足式攀爬机器人设计,可将任意带肢体的机器人建模为带浮动基座的关节多体系统,在任意环境中模拟行走与攀爬。平台支持调节倾角、重力、地面刚度等环境参数,可加载任意点云作为地形图,并采用刚体动力学引擎。论文给出了仿真器结构、计算流程,以及四足机器人贴附墙面或攀爬陡坡的示例。
论文提出 Entity-Level Goal Readout,把可执行的终态目标作为 3D trace 世界模型的显式输出,结合以物体为中心的位姿预测与基于观测深度的平移,生成 SE(3) 紧凑目标,再由共享的 Pose-Native Executor 结合在线物体位姿反馈进行闭环控制,无需重跑世界模型。
论文提出 Conformal Event-Triggered Risk-Certified Replanning(CERT-Replan)框架,用校准后的屏障风险作为重规划的预警信号,在线校准障碍预测残差并评估动态障碍安全裕度。
Co²Skill 提出统一策略,将场景交互与灵巧物体操作整合到同一全身控制框架中,基于预训练运动先验并使用任务与阶段相关的观测掩码选择信息。该方法引入目标条件下的 loco-manipulation 课程与跨任务课程,联合训练单项技能和选定任务序列,在任务边界保持物理状态并维持抓取。在坐、站、爬、上下楼梯及目标导向操作等任务上完成评估,并在室内环境中演示了技能组合。
LACE-CRAFT 提出一种机器人协同设计方法,通过 Actor 参数继承与 Blackboard 协作,在形态搜索中复用已有控制经验。在五个运动基准上,其三个评估种子的平均得分较 D2C 高 6.4-91.9%。两种方法均在五轮中训练 30 个新形态-奖励对,LACE 另使用四个续训单元,并通过实物原型演示了室内行走与几何到硬件的工作流。
RoboRender 是一个将模拟轨迹转换为照片级 RGB 视频的框架,以模拟深度视频、语言指令和机器人 RGB mask 视频为条件训练面向机器人的视频生成模型,在保留模拟器几何、机器人运动和动作标签的同时合成真实纹理、背景与干扰物。
论文提出 Robo-COP,让 VLM 编排器与 VLA 策略在部署过程中协同演化:从自身执行中整理技能演示,在数据能解决反复失败时微调策略,并在新策略确实提升对应技能后才采纳。
论文提出多物体多目标抛掷(MOMT)的两阶段快速规划框架,离线建模可行集,在线生成可行抛掷动作的序列组合耗时低于 5 ms。在 7-DoF 机械臂配多指手的平台上,仿真中双物体协同抛掷较独立单物体规划缩短执行时间至多 46%,三物体保持该提升;真机双物体实验确认缩短 29%,与理论 50% 的差距来自抛掷间过渡开销。
论文提出 Codebook-Aligned Prediction(CAP),将动作分词器学到的码本向量直接用作策略类别原型,替代从零训练的分类头,分词器与策略骨干其余部分保持不变。
论文提出 ProAct 动作分词器训练方法,在重建目标之外增强下游可预测性与鲁棒性,该方法与策略无关且仅用动作数据训练。在 Robomimic、LIBERO、RoboTwin 基准及多种分词器架构上,ProAct 平均提升 rollout 成功率 11.3 个百分点,迁移到视觉语言动作策略和真实机器人操作时分别平均提升 21.8 和 36.7 个百分点。