RealtimeWAM:面向世界动作模型的低延迟推理框架
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
RealtimeWAM 提出一个免训练的通用框架,通过并行执行与自适应计算降低世界动作模型(WAM)的推理延迟,可在 FastWAM 和 OpenWAM 等多种架构上复用。
一篇 arXiv cs.RO 论文提出基于 Model Predictive Control (MPC) 的分布式控制器,用于高效执行基于 braid 的拓扑约束。
Video-to-Model 框架可从输入视频自动建模可变形缝合线的运动:感知模块定位并跟踪缝合线,时空 CNN 网络估计结构化 CBF-CLF-QP 模型的有效参数,再在用户定义的针头速度输入下仿真缝合线。在未见过的缝合线构型与运动上的实验表明,该框架能可靠重建缝合线行为、自动配置模型并以低跟踪误差复现预期运动,减少手动调参需求。
论文提出仅依靠软光学触觉传感在线估计接触力与可能时变任务帧的方法,用于混合力/运动控制,假设局部平面接触且接触力矩可忽略。该方法将弹性体单帧形变图像映射为压入深度、两个相对传感器倾斜角和3D接触力,每个量附带逐样本不确定性估计;映射通过自标注流程学习,由机械臂施加受控接触并用辅助Force/Torque传感器离线提供真值标签。
研究团队构建了配备人工肌肉、多模态传感器和强化学习训练的神经网络控制器的机器人运动系统类比模型,实现了精准运动与损伤鲁棒性,并复现出类似动物的神经群体动力学。研究发现神经旋转会产生垂直于抓取方向的振荡机动以优化轨迹调整,该结论经灵长类神经数据验证,同时揭示了传感器与运动冗余下的反直觉神经能量原则。
论文提出一套视觉系统,由带臂载相机的四足机器人对 nano-UAV 进行定位:四足跟踪无人机,用分割掩码与深度估计其在自身坐标系中的位置,并通过实时无线电链路发送。
论文提出 DRIVE(Diversity-driven RL fIne-tuning for VLA gEneralization),把成功行为的多样性显式纳入 RL 微调目标:在相同任务条件下对 rollouts 分组、做时间对齐的轨迹比较,并从相对行为多样性中导出成功条件下的内在奖励,以扩大可行解空间覆盖而不奖励失败的多样或表面时序差异。
Juno 提出一个围绕动作条件 JEPA 构建的统一框架,将其同时用作控制对齐的表征骨干、预测教师和可适配的动力学模型,以解决 VLA 中预测隐变量与具身控制不匹配、干扰动作学习、教师在分布偏移下失准三类问题。
论文提出 MILD 操作接口定位数据集与 AprilVINS 定位方法,用于 UMI 式机器人操作示教中的末端执行器定位。MILD 真实子集包含 Insta360 X5 与 Insight9 采集的 86 段传感器序列、15 项重复桌面任务及每次执行的机器人末端参考轨迹,仿真子集 MILD-Sim 在 Isaac Sim 中扩展任务覆盖。
论文提出一种紧凑型移动机器人,用折纸结构轮实现移动并主动调节传感几何:轮子在地形自适应构型间切换时底盘俯仰带动 2D LiDAR 扫过不同高度,IMU 提供姿态,融合节点将 LiDAR 点云投影进 RTAB-Map 的 RGB-D 深度流。
研究提出一种端到端方法,仅输入网格装配体即可自动生成逐步装配手册或结构化失败报告,无需关节元数据或紧固件标注。该方法自主完成装配工具清单、装配顺序与子装配、装配手册及可装配性设计反馈四项内容,其中顺序规划通过在物理仿真器中系统性拆解物体并应用编码DfA原则的成本函数实现。
论文提出一套端到端自主流水线,用于定制木质装配体的设计与物理构建,生成式 AI 代理将用户提示转为初始 3D 几何,并通过图注意力网络代理的梯度修复阶段反向传播调整组件几何。该方法在 60 条新颖自然语言输入上使机器人拧螺丝成功率达 86.7%,显著优于先前工作十倍,并用两台 UR5e 机器人对其中十个结构完成了物理可装配性演示。
AeroEval 是一个代理辅助中间件,对 LLM 生成的无人机任务做分阶段校验,先验证程序语法、平台 API 用法与任务意图,再结合执行轨迹、任务需求和环境上下文评估实际行为,每阶段返回结构化失败信息用于迭代重生成。
论文提出 ΔWAM,通过动作切线场(Action Tangent Fields)对动作如何诱导未来动力学变化做局部 Taylor 展开,把世界监督重新表述为与动作紧密耦合的一阶结构,并蒸馏进 WAM 的去噪监督。
论文提出 YUBI-STAG 框架,结合接触物体分割与视觉语言模型,为操作演示自动标注物体身份、属性状态、单臂动作、双臂协同与空间交互,以对齐预训练 VLA 与细粒度操作语言。
论文提出 RoboPace,一个面向动作块策略的在线重定时层,在保留策略几何路径的前提下按预测接触调整执行速度,同时兼顾接触相关速度限制与机器人运动学、动力学约束,无需重训练策略即可实时运行。在双臂机器人的三个接触丰富任务上,快速均匀执行和仅按物理限速的重定时大多失败,而 RoboPace 的整体成功率高于慢速均匀执行,并在约一半时间内完成五条指令中的四条。
论文提出 planner 无关的视觉表征对齐框架 ViRA,在保持规划器架构与推理成本不变的前提下研究视觉基础模型(VFM)何时能提升驾驶性能。研究发现 VFM 引导的表征在多种端到端规划器上均能稳定提升性能并泛化到零样本闭环评测;VFM 目标的选择会影响规划性能,而辅助感知监督可将五个目标间的 EPDMS 差距从 2.7 分缩小到 0.5 分。
论文提出面向 AUV 速度估计的 NAViLoss 目标函数,联合惩罚导航状态域的速度估计残差与 DVL 测量域的波束一致性残差,其有界形式限制大残差影响,自适应机制调节波束几何不确定性。NAViLoss 与 DeepONet 架构结合构成 NAVi-DeepONet 模型,使用多次真实海试采集的约 10,000m 半合成 AUV 实验数据评估,速度估计精度较传统与学习型基线提升 44%。
一项研究提出面向腱驱动机械臂的多目标优化方法,用 NSGA-II 同时最大化关节扭矩并最小化臂厚,优化肌腱走线、滑轮配置与附着点。结果得到 Pareto 最优设计,通过策略性捷径有效扩大等效力臂,为紧凑高扭矩机械臂提供设计指南,其优化构型呈现超出常规设计直觉的非平凡规律。该论文已被 Advanced Robotics 接收。
一项基于 MixVPR 视觉地点识别的示教-重复导航系统在真实场景测试中实现室内外运行,鲁棒性与导航精度达到其他先进系统水平,同时硬件需求更低,适用于更广泛的机器人平台。该工作为 2025 European Conference on Mobile Robots (ECMR) 论文,共 6 页、5 幅图。
一项研究提出面向机器人控制的自适应代码生成架构框架,采用双 AI 设计:LLM 将高层意图翻译为限定在形式化机器人库内的可执行程序代码,VLM 通过蒸馏过程提供语义锚定。框架引入基于几何与语义阈值的环境驱动重规划触发机制,配合持续运行时监控与自适应规划循环。在前沿模型上的基准测试表明,将生成式 AI 置于响应式受限循环中,可在动态未知环境下稳健完成复杂意图。
该论文研究可变形线状物体(绳)的单次挥击操作,目标同时指定绳尖 3D 位置与到达方向。作者将 DeformX 仿真器扩展为 DeformX2.0,加入 GPU 加速、稳定的 Cosserat 杆求解器和横流气动模型,速度提升超过 $20{,}000\times$;并提出 TRACE 生成挥击数据训练条件流匹配策略,仿真准确率达 92.1%。
论文提出 Targeted Modality Dropout(TMD),通过注意力估计各模态依赖度并选择性丢弃最主导模态,配合依赖分布的熵正则化,提升多模态模仿学习策略的鲁棒性。
论文提出紧凑磁纤毛触觉传感器 MagCilia,将柔性磁纤毛结构与 Hall 传感器结合实现 3D 力感知,并提出因果历史融合回归 CHFR 从耦合磁通道重建力。
论文提出 FACE,一个接触因素分解的模仿学习框架,将任务意图与环境相关的接触因素分离。其表示在归一化的接触相对坐标中表达交互力,并通过学习的接触法线估计器与在线摩擦估计器推断局部接触法线和有效摩擦尺度,从而在执行中把力观测编码、把策略输出解码为运动与力指令,无需更新策略参数即可适配当前接触条件。
SIGMA 提出一种仿真在环(simulation-in-the-loop)的快慢协作框架,将规划器嵌入不确定性评估,通过 expected planning gain(EPG)指标决定何时调用云端大模型推理。在 CARLA 实验中,相比固定周期协作,SIGMA 将不必要的云端交互减少 50%,导航成功率提升超过 6%,动态场景下完成时间最多缩短 26.2%。
论文提出 SOUL(Sparse feature pOlicy UnLearning),针对 VLA 模型反复出现的状态幻觉问题,选择性遗忘与幻觉行为相关的策略知识,其中幻觉失败与成功行为对应的稀疏特征分别作为遗忘和保留目标。
论文介绍 SiGNgapore 数据集,用手持设备在新加坡多处公共场所采集,聚焦以导航标志为核心的无地图导航决策。数据包含 RGB、稀疏深度、里程计与 IMU 测量,提供 56 个长程导航任务和超过 450 个标志中心场景,附带可读格式数据、转换为 ROS 2 的工具脚本、场地地图以及与 GPS 对齐的场景图。
论文提出 ResGAC,一种结合几何导纳控制(GAC)与残差强化学习的人形机器人全身控制器,用于在浮动基座振荡、重力与运动干扰下实现精确的 SE(3) 末端执行器位姿跟踪。
论文提出 TMT,一种基于 Token Manifold 与潜空间 Transition 建模的运行时后门检测器,用于在未见任务上检测被植入后门的 VLA 策略。
论文提出 RobotAPO,一个在连续 flow-matching 去噪空间中运行的对抗式物理偏好优化框架,用于机器人操作视频生成,并发布 AgiBot-PhysPref 数据集,含 10,000 条隔离条件匹配物理违例的偏好样本。
TempoBridge 是一个轻量框架,利用冻结的 VLA 表征按指令中的节奏线索在各任务阶段调制动作,无需额外的节奏条件机器人演示或针对节奏的基策略微调。它从上下文 VLM 表征中提取节奏线索,通过因果阶段路由与任务进度对齐,并在执行中调制标称运动指令。
IVG-UAV 提出一套语音控制的 UAV 系统,用于大型种植园的成熟水果自主采摘,集成 Whisper 语音识别与 LLM、基于计算机视觉的成熟度分类以及自适应路径规划。整个系统在 Gazebo 仿真环境中建模与验证,可在受控农业场景下评估性能。
论文提出 Immiscible Diffusion Policy,一种免标签的训练期附加方法,通过动作-噪声分配保持相对独立的噪声到动作路径,不改动策略架构与推理流程,以缓解扩散策略坍缩到单一模态的问题。
COOL 是一个机器人框架,能从日常观察中自主学习物体归属关系并维护长期空间记忆,已获 CoRL 2026 接收。它采用基于智能体的 curiosity-driven 数据采集策略,引导机器人前往最有价值的地点获取信息并刷新过期观测。离线实验、消融研究与真实场景评测表明,COOL 能从真实人机交互中推断归属关系,并据此完成归属条件下的导航与任务执行。
论文提出约束学习框架 Counterfactual KKT(CF-KKT),利用局部学习的可微动力学模型对演示施加 KKT 最优性条件,并生成奖励提升的反事实行为合成不可行数据,从而在无需已知动力学和额外危险探索的情况下恢复未知约束。
论文提出 MCFR,一个掩码引导由粗到精的回归框架,用于解决 3C 制造中多型号板对板(BTB)连接器自动插装的视觉精度与部署鲁棒性问题。该方法引入目标感知掩码先验和显式光度精修,抑制背景干扰、缓解固定视角检测下训练与部署不匹配带来的背景虚假相关。
ClimbLab 是一个开源的 MATLAB 仿真与分析平台,专为足式攀爬机器人设计,可将任意带肢体的机器人建模为带浮动基座的关节多体系统,在任意环境中模拟行走与攀爬。平台支持调节倾角、重力、地面刚度等环境参数,可加载任意点云作为地形图,并采用刚体动力学引擎。论文给出了仿真器结构、计算流程,以及四足机器人贴附墙面或攀爬陡坡的示例。
论文提出 Entity-Level Goal Readout,把可执行的终态目标作为 3D trace 世界模型的显式输出,结合以物体为中心的位姿预测与基于观测深度的平移,生成 SE(3) 紧凑目标,再由共享的 Pose-Native Executor 结合在线物体位姿反馈进行闭环控制,无需重跑世界模型。
论文提出 Conformal Event-Triggered Risk-Certified Replanning(CERT-Replan)框架,用校准后的屏障风险作为重规划的预警信号,在线校准障碍预测残差并评估动态障碍安全裕度。