基于 MixVPR 视觉地点识别的快速鲁棒示教-重复导航
一项基于 MixVPR 视觉地点识别的示教-重复导航系统在真实场景测试中实现室内外运行,鲁棒性与导航精度达到其他先进系统水平,同时硬件需求更低,适用于更广泛的机器人平台。该工作为 2025 European Conference on Mobile Robots (ECMR) 论文,共 6 页、5 幅图。
一项基于 MixVPR 视觉地点识别的示教-重复导航系统在真实场景测试中实现室内外运行,鲁棒性与导航精度达到其他先进系统水平,同时硬件需求更低,适用于更广泛的机器人平台。该工作为 2025 European Conference on Mobile Robots (ECMR) 论文,共 6 页、5 幅图。
一项研究提出面向机器人控制的自适应代码生成架构框架,采用双 AI 设计:LLM 将高层意图翻译为限定在形式化机器人库内的可执行程序代码,VLM 通过蒸馏过程提供语义锚定。框架引入基于几何与语义阈值的环境驱动重规划触发机制,配合持续运行时监控与自适应规划循环。在前沿模型上的基准测试表明,将生成式 AI 置于响应式受限循环中,可在动态未知环境下稳健完成复杂意图。
该论文研究可变形线状物体(绳)的单次挥击操作,目标同时指定绳尖 3D 位置与到达方向。作者将 DeformX 仿真器扩展为 DeformX2.0,加入 GPU 加速、稳定的 Cosserat 杆求解器和横流气动模型,速度提升超过 $20{,}000\times$;并提出 TRACE 生成挥击数据训练条件流匹配策略,仿真准确率达 92.1%。
论文提出 Targeted Modality Dropout(TMD),通过注意力估计各模态依赖度并选择性丢弃最主导模态,配合依赖分布的熵正则化,提升多模态模仿学习策略的鲁棒性。
论文提出紧凑磁纤毛触觉传感器 MagCilia,将柔性磁纤毛结构与 Hall 传感器结合实现 3D 力感知,并提出因果历史融合回归 CHFR 从耦合磁通道重建力。
论文提出 FACE,一个接触因素分解的模仿学习框架,将任务意图与环境相关的接触因素分离。其表示在归一化的接触相对坐标中表达交互力,并通过学习的接触法线估计器与在线摩擦估计器推断局部接触法线和有效摩擦尺度,从而在执行中把力观测编码、把策略输出解码为运动与力指令,无需更新策略参数即可适配当前接触条件。
SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。
论文提出 SOUL(Sparse feature pOlicy UnLearning),针对 VLA 模型反复出现的状态幻觉问题,选择性遗忘与幻觉行为相关的策略知识,其中幻觉失败与成功行为对应的稀疏特征分别作为遗忘和保留目标。
论文介绍 SiGNgapore 数据集,用手持设备在新加坡多处公共场所采集,聚焦以导航标志为核心的无地图导航决策。数据包含 RGB、稀疏深度、里程计与 IMU 测量,提供 56 个长程导航任务和超过 450 个标志中心场景,附带可读格式数据、转换为 ROS 2 的工具脚本、场地地图以及与 GPS 对齐的场景图。
论文提出 ResGAC,一种结合几何导纳控制(GAC)与残差强化学习的人形机器人全身控制器,用于在浮动基座振荡、重力与运动干扰下实现精确的 SE(3) 末端执行器位姿跟踪。
论文提出 TMT,一种基于 Token Manifold 与潜空间 Transition 建模的运行时后门检测器,用于在未见任务上检测被植入后门的 VLA 策略。
论文提出 RobotAPO,一个在连续 flow-matching 去噪空间中运行的对抗式物理偏好优化框架,用于机器人操作视频生成,并发布 AgiBot-PhysPref 数据集,含 10,000 条隔离条件匹配物理违例的偏好样本。
TempoBridge 是一个轻量框架,利用冻结的 VLA 表征按指令中的节奏线索在各任务阶段调制动作,无需额外的节奏条件机器人演示或针对节奏的基策略微调。它从上下文 VLM 表征中提取节奏线索,通过因果阶段路由与任务进度对齐,并在执行中调制标称运动指令。
IVG-UAV 提出一套语音控制的 UAV 系统,用于大型种植园的成熟水果自主采摘,集成 Whisper 语音识别与 LLM、基于计算机视觉的成熟度分类以及自适应路径规划。整个系统在 Gazebo 仿真环境中建模与验证,可在受控农业场景下评估性能。
论文提出 Immiscible Diffusion Policy,一种免标签的训练期附加方法,通过动作-噪声分配保持相对独立的噪声到动作路径,不改动策略架构与推理流程,以缓解扩散策略坍缩到单一模态的问题。
COOL 是一个机器人框架,能从日常观察中自主学习物体归属关系并维护长期空间记忆,已获 CoRL 2026 接收。它采用基于智能体的 curiosity-driven 数据采集策略,引导机器人前往最有价值的地点获取信息并刷新过期观测。离线实验、消融研究与真实场景评测表明,COOL 能从真实人机交互中推断归属关系,并据此完成归属条件下的导航与任务执行。
论文提出约束学习框架 Counterfactual KKT(CF-KKT),利用局部学习的可微动力学模型对演示施加 KKT 最优性条件,并生成奖励提升的反事实行为合成不可行数据,从而在无需已知动力学和额外危险探索的情况下恢复未知约束。
论文提出 MCFR,一个掩码引导由粗到精的回归框架,用于解决 3C 制造中多型号板对板(BTB)连接器自动插装的视觉精度与部署鲁棒性问题。该方法引入目标感知掩码先验和显式光度精修,抑制背景干扰、缓解固定视角检测下训练与部署不匹配带来的背景虚假相关。
ClimbLab 是一个开源的 MATLAB 仿真与分析平台,专为足式攀爬机器人设计,可将任意带肢体的机器人建模为带浮动基座的关节多体系统,在任意环境中模拟行走与攀爬。平台支持调节倾角、重力、地面刚度等环境参数,可加载任意点云作为地形图,并采用刚体动力学引擎。论文给出了仿真器结构、计算流程,以及四足机器人贴附墙面或攀爬陡坡的示例。
论文提出 Entity-Level Goal Readout,把可执行的终态目标作为 3D trace 世界模型的显式输出,结合以物体为中心的位姿预测与基于观测深度的平移,生成 SE(3) 紧凑目标,再由共享的 Pose-Native Executor 结合在线物体位姿反馈进行闭环控制,无需重跑世界模型。
论文提出 Conformal Event-Triggered Risk-Certified Replanning(CERT-Replan)框架,用校准后的屏障风险作为重规划的预警信号,在线校准障碍预测残差并评估动态障碍安全裕度。
Co²Skill 提出统一策略,将场景交互与灵巧物体操作整合到同一全身控制框架中,基于预训练运动先验并使用任务与阶段相关的观测掩码选择信息。该方法引入目标条件下的 loco-manipulation 课程与跨任务课程,联合训练单项技能和选定任务序列,在任务边界保持物理状态并维持抓取。在坐、站、爬、上下楼梯及目标导向操作等任务上完成评估,并在室内环境中演示了技能组合。
LACE-CRAFT 提出一种机器人协同设计方法,通过 Actor 参数继承与 Blackboard 协作,在形态搜索中复用已有控制经验。在五个运动基准上,其三个评估种子的平均得分较 D2C 高 6.4-91.9%。两种方法均在五轮中训练 30 个新形态-奖励对,LACE 另使用四个续训单元,并通过实物原型演示了室内行走与几何到硬件的工作流。
一项研究评估了两个机器人智能体间协同进化的通信机制从离散 2D 仿真器迁移到具备真实物理的 3D 仿真器后的功能保持情况。结果显示成功率在 2,000 至 6,000 物理步的时间预算内近似线性增长且无平台期,短时评估会低估控制器性能;social cue 在两种仿真器中主要起拥堵辅助作用而非导航引导,8 次独立进化运行显示角色不对称方向一致但幅度各异。
RoboRender 是一个将模拟轨迹转换为照片级 RGB 视频的框架,以模拟深度视频、语言指令和机器人 RGB mask 视频为条件训练面向机器人的视频生成模型,在保留模拟器几何、机器人运动和动作标签的同时合成真实纹理、背景与干扰物。
论文提出 Robo-COP,让 VLM 编排器与 VLA 策略在部署过程中协同演化:从自身执行中整理技能演示,在数据能解决反复失败时微调策略,并在新策略确实提升对应技能后才采纳。
论文提出多物体多目标抛掷(MOMT)的两阶段快速规划框架,离线建模可行集,在线生成可行抛掷动作的序列组合耗时低于 5 ms。在 7-DoF 机械臂配多指手的平台上,仿真中双物体协同抛掷较独立单物体规划缩短执行时间至多 46%,三物体保持该提升;真机双物体实验确认缩短 29%,与理论 50% 的差距来自抛掷间过渡开销。
arXiv 论文提出一种信念空间规划方法,沿评估轨迹预测、传播并惩罚规划器条件化的估计器误差,用仿射误差动力学与矩递推建模间歇随机修正带来的额外不确定性。仿真中对倾转旋翼 VTOL 舰船甲板降落进行滚动时域规划,条件化建模使命令盲 EKF 的误差预测损失相对规划器无关模型降低 13.4%。
一项在 AGX Orin 与 Pololu 3pi+ RP2040 上开展的硬件在环评测显示,任务准入合并能在 48 个条件中的 31 个减少分配器调用与处理器开销,但收益取决于到达强度与分配器类型。
论文提出 Codebook-Aligned Prediction(CAP),将动作分词器学到的码本向量直接用作策略类别原型,替代从零训练的分类头,分词器与策略骨干其余部分保持不变。
论文提出 ProAct 动作分词器训练方法,在重建目标之外增强下游可预测性与鲁棒性,该方法与策略无关且仅用动作数据训练。在 Robomimic、LIBERO、RoboTwin 基准及多种分词器架构上,ProAct 平均提升 rollout 成功率 11.3 个百分点,迁移到视觉语言动作策略和真实机器人操作时分别平均提升 21.8 和 36.7 个百分点。
论文提出 geodex,一个开源 C++20 库并提供 Python 绑定,用于在机器人位形空间的内在几何上进行运动规划。
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文在两个架构族的四个已发布 checkpoint 上观察到世界模型对动作变化敏感度弱、对已验证失败给出成功样预测,并提出 CureWM 方法:从成功演示构造替代动作、在仿真或硬件中执行验证结果,再用得到的失败与存活成功微调已发布模型。
FlashNeRD 通过并行流式架构、可在任意位置接受接触的编码器,以及与解析求解器对象的双向耦合,解决了 Neural Robot Dynamics (NeRD) 加速有限、仅支持预定义接触点、与被操作对象缺乏双向耦合三个局限。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
MimicX 提出一种 policy-in-the-loop 框架,利用执行反馈精化视频驱动的人形动作跟踪训练监督,定位困难过渡与受影响身体部位,并联合调整跟踪目标与 reset 课程。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
一篇被 2026 IEEE/RSJ IROS 空间机器人研讨会接收的论文提出了一种证据驱动的人-智能体-机器人协作架构,用于深空任务中脱离地面支持的异常分诊。该架构将 Agentic AI 作为有状态协调器,通过分诊状态管理器维护假设与证据溯源,并由移动机器人获取局部证据,已在基于 Reachy Mini 和 Innate MARS 移动机器人的硬件在环原型上验证。