NVIDIA Isaac Sim 中六自由度管道跟踪 ROV 的强化学习与经典控制统一动力学框架
研究者在 NVIDIA Isaac Sim 中为六自由度 BlueROV2-Heavy 管道跟踪 ROV 建立统一动力学框架,用同一 USD 场景向向量化 NumPy 的 Fossen 方程与 PhysX 力施加提供一致的质量、附加质量、阻尼、浮力与推力器参数。
研究者在 NVIDIA Isaac Sim 中为六自由度 BlueROV2-Heavy 管道跟踪 ROV 建立统一动力学框架,用同一 USD 场景向向量化 NumPy 的 Fossen 方程与 PhysX 力施加提供一致的质量、附加质量、阻尼、浮力与推力器参数。
DiVeR 通过采样动作表示的离散度估计决策关键性,并据此对验证器学习加权,无需步级标注或额外环境交互。在 LIBERO、RoboCasa 及 Franka Research 3 真机实验中,DiVeR 通过更有效的验证器引导动作选择持续提升任务成功率,同时验证器推理开销可忽略。
机器人智能体框架 RobotUse 在 RoboLab 上取得 45% 任务成功率,较 CaP-X 高出 6.7 个百分点,同时保持紧凑的决策上下文。智能体通过视觉选择目标与位姿,后端负责几何、运动规划与控制,子智能体在各子目标内保留详细交互信息供后续决策使用。该框架通过更新持久化 playbook 从真实执行中学习,并将所学迁移到后续任务。
TANav 用一次短暂轻推测量推压阻力,由 TacPhys 读取力序列(可选 RGB-D 与运动学)估计质量以决定是否授权推压。仿真中将漏推率从 28.7% 降至 5.5%,重复巡逻下恢复 oracle 90% 的路径节省、边界违规从 4.3% 降至 2.9%。
PreAct-Nav 提出一种智能体导航框架,为冻结策略加入预期推理以实现稳健的城市导航。框架以导航记忆模块维护中程子目标与经验,并用动作条件世界模型 AC-WM 预测候选动作后果,由视觉语言模型 VLM 推理器据此保留或修正动作。评测显示该方法通过记忆更新与视觉预测改善动作选择,在更长、转弯更多的路线上增益更明显。
论文提出 R²-WAM,一个两阶段修复与拒绝的后训练框架,先用运动学对齐分数提升预测未来与输入动作的一致性,再用修复后的视频模型比较采样动作与示范动作的想象结果,对任务进度低于示范参考一定裕度的样本做负向微调,无需额外环境交互或改动推理流程。
提出 GJK-CBF,用 Gilbert-Johnson-Keerthi (GJK) 算法获取最小距离或穿透深度对应的 witness pair,并直接由其相对刚体运动构造控制障碍函数(CBF)梯度,无需可微优化(diffOpt)。
研究提出基于采样的扰动观测器 SDOB,将扰动观测器原理从显式被控对象模型扩展到仿真器与学习型世界模型,通过状态回放或代价查询接口估计未测量扰动。SDOB 区分状态效应扰动与代价扰动两类可观测通道。仿真与真机实验表明其可补偿 Sim-to-Real 失配并改善控制性能。
研究提出 ExStereo 立体模块,用立体图像对重建场景几何并渲染多视图作为显式立体表示,通过 action-stereo cross-attention 让动作 token 选择性关注立体 token,使策略基于 3D 场景信息生成机器人动作。
提出分布式级联力控制(DCFC),使配备 360 度视觉软触觉传感器的多机器人在无机器人间通信下协同推动刚体朝移动目标方向运动。内环融合接触力与定位,外环协调推力方向,对未知物体质量具有鲁棒性,并用 Lyapunov 稳定性理论验证收敛性。仿真与真实实验验证了多机器人协同推动效果,成果发表于 2024 IEEE/SICE SII。
该论文提出一种混合 flow matching 规划器,用 masked discrete flow matching 生成符号任务计划、用 continuous flow matching 生成运动轨迹,可从较小规模的真实示范学习并闭环执行。
研究者用 flow-matching 策略的输入构造技能级动作,使一次完整技能执行对应一次世界模型转移,并提出压缩种子、两种从演示学习的离散码和符号标签四种动作抽象。在需最多 14 个顺序技能的模拟积木重排任务中,符号标签在最多六个技能的任务上成功率超 90%,无标签的物体中心学习码在单技能任务上与之相当。消融显示标签优势主要来自规划器知晓动作适用性,超过六个技能后限制成功率的是搜索而非世界模型。
PatternDex 提出从人类-物体演示中学习手与物体运动的相关性并表示为 token 序列(交互模式),据此估计适配目标机器人的腕部运动与接触点,作为强化学习策略的引导,从而避免 embodiment gap。
DNPush 提出一种分布式非平行推力控制器,使多机器人在无机器人间通信、无需物体模型与质心估计的条件下协同搬运物体。控制器依据本地力方向偏差按 reciprocal-sine 律调节非平行力幅值,Lyapunov 分析证明系统收敛到唯一旋转平衡点,物体速度收敛至期望搬运方向。
研究提出针对 LLM 机器人团队的隐蔽内部攻击模型:单个被攻陷机器人在多机器人测绘任务中,受限于团队检测器而非能量预算。推导出两个界——攻击报告被验证概率的下界(取决于通信图度数与验证预算),以及线性规划给出的地图误差上界,揭示"少说谎、说大谎"的最优攻击策略。实验中诚实机器人为 LLM agent,两个界在攻击实际花费的预算处均成立,且 LLM 复查记录的选择无偏但复查量不可预测。
研究提出通过柔性 Fin Ray 夹爪的形变进行视觉力预测,实现无需力或触觉传感器的力感知操作。方法先在标定数据上训练视觉力估计器为演示标注力,再训练动作-力联合生成策略,测试时选取预测力最接近目标的候选动作。在摘莓、抓空罐、手内重定向和插头插入任务上验证了可行性。
研究表明,全驱动多旋翼在仅给定位置轨迹时,最小化正齐次分配代价(含标准最小范数伪逆分配)会选出欠驱动式行为。通过 fiberwise infimization 将执行器输出代价映射到 wrench 空间,得到齐次下确界分配代价,并推导出精确最优性间隙分解。扰动或运动改变力方向时,全驱动平台可立即用横向权限生成新力并转向新最小代价族,而结构欠驱动平台须先转向,因此全驱动价值在于抗扰与瞬态力生成。
TTT-RM 将 Test-Time Training 重构为残差记忆,用快速权重补充有界记忆库,保留当前上下文无法恢复的任务相关历史信息。该方法学习历史解码器,以重建残差作为 TTT 慢权重优化目标,使在线快速权重更新编码互补历史。在记忆密集型仿真基准与真实任务上,TTT-RM 在多种记忆设计中一致提升,支持三分钟八阶段收纳任务的持续执行。
RoboIRS 是一种推理时内部表征引导方法,利用成功与失败的 rollout 训练线性分类器、选择与结果相关的干预位置并推导任务特定的引导方向,无需更新策略参数。
PerturBot 通过任务保持的腕部视角扰动、决策相关字幕增强指令,以及随机与失败轨迹片段重标注,削弱视觉-语言-动作(VLA)策略对模态捷径的依赖,且不改变推理过程。配套提出的 GroundingFscore 是一种离线评分,用于诊断策略对模态捷径的依赖程度,与任务成功率结合可判断策略是否健康扩展。
一个端到端可微有限元(FEM)框架将 CAD 自动转换为体素化四面体黏弹性网格,用于气动软体机器人建模与系统辨识。结合点云数据,该框架以最小实验装置辨识材料与动态驱动参数,并利用梯度完成轨迹优化。在波纹管式气动软体机器人上验证,最大位置误差小于 3 mm,可用于路径跟随与抓取任务。
提出一种上下文贝叶斯优化框架,用于分层控制系统中质心预测控制器与全身控制器的联合参数学习,保留任务性能、实现质量与控制努力的独立观测,并用相关多输出高斯过程建模。在不同箱体质量下的人形机器人推箱移动操作任务中,该方法在训练与适应阶段均取得所比较基线中最低的平均经验遗憾。
Zhe Tao 等提出 ForeAct3D,用可学习几何查询从策略表示解码深度、语义分割与相机位姿,并以策略生成的 action chunk 条件化未来查询,把未来预测锚定到计划动作上。
RiskFly 提出一种单阶段规划器,用视锥对齐的时空风险场预测危险出现的位置与时间,替代仅输出标量轨迹代价的编码信号。双流观测将短深度序列与倒球面距离图序列配对,辅助头回归由特权最近接近点(CPA)目标监督的风险场,并沿五次轨迹可微查询。仿真与零样本真实飞行显示,在资源受限平台上成功率更高且端到端时延相当。
Jar Jar ROV 是面向中学生公民科学水质监测的低成本开源遥控潜水器(ROV)平台,已在某州 100 多名学生中大规模部署,学生自行搭建、编程并在当地湖泊投放。项目收集了近 1.1 万条经验证的温度、pH、溶解氧和浊度测量数据,ROV 搭建环节获导师满分评价。评估发现电子组装和数据上传等复杂任务中学生参与度明显下滑,论文据此提出降低技术门槛的改进路线。
提出一种雷达-LiDAR-相机在线无目标外参联合标定框架,为每对传感器构建残差并整体优化全部外参,避免两两标定结果跨三传感器不一致。框架引入基于距离相关裕度的自适应雷达噪声滤波器剔除虚假回波,并通过跨帧累积聚合稀疏雷达对应点。在覆盖多种城市环境的自采雷达-LiDAR-相机数据集上,该方法在所有传感器对上的标定误差均优于先进的相机-LiDAR 基线。
NM-LIO 提出噪声感知的多 LiDAR 惯性里程计方法,通过集成噪声模型量化每个 LiDAR 的测量噪声,并基于测量噪声估计残差不确定性,使测量模型能捕捉不同 LiDAR 间的噪声差异。该方法在公开多 LiDAR 数据集上与最新方法对比,实验结果表明其能在多种环境中准确估计里程计。论文发表于 RiTA 2024。
DreamFormer 提出一种基于模型的智能体,先从无结构玩耍数据学习任务无关的 Transformer 世界模型,再在隐空间想象中通过内在奖励对齐专家演示来习得语言条件的多任务操作技能。
WasserMan 是首个面向浮基水下接触操作视动学习的多任务仿真基准,提供 10 个专家可解任务、2 个载体-机械臂平台、双臂构型与水下动力学,其中 9 个任务支持已学习策略评测。
ReSQ-MPPI 提出一种"生成—精修"架构,用离线计算的 Hamilton–Jacobi 可达性(HJR)值函数引导 MPPI 采样,再以少量序列二次规划(SQP)迭代在全阶 MPC 问题中精修解。
AgenticTactileVLA 提出一种执行期监督器,用手指位置和电机力反馈作为本体接触证据,在不使用触觉传感器、不重训练 VLA 的前提下修正抓取实现。
FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。
CrashSim 用真实碰撞先验引导多智能体生成式交通仿真,生成更贴近真实碰撞演化过程与碰撞类型分布的自动驾驶安全评测场景。基于 CrashSim 构建的 nuCrash 数据集包含 4,000 多个碰撞与近碰撞场景,对 5 个自动驾驶规划器的闭环评测显示其比 nuScenes 更能暴露规划器安全能力差异。LLM 辅助评测代理进一步给出能力级诊断与改进指导。
TacOT 提出触觉引导最优传输框架,用动作-触觉动态时间规整识别人类与机器人演示中交互动力学一致的对应关系,再引导共享策略表示空间中的软最优传输对齐,无需预定义帧级配对。在 4 个真实灵巧操作任务上,闭环成功率较 action-guided OT 在分布内任务最高提升 17 个百分点,在定向人到机器人分布外迁移下提升 20 个百分点。
研究者提出 ATOC(Asynchronous Tracking and Optical Communication)系统,将 LED smart-beacon 调制、事件相机检测、光学跟踪与事件数据解调集成到单一管线,可同时跟踪并解调多个 LED smart beacon,把传统视觉标记变成定向、空间局部化的通信通道。系统在实验室研究、智慧城市演示和 3D 动作捕捉系统中得到验证。
该研究提出一种两阶段混合逆运动学框架,用于求解人形机器人 7-DoF 偏置冗余机械臂的逆运动学:先用近似解析模型枚举候选关节解,再用轻量学习预测器结合 split-conformal prediction 给出校准难度上界排序种子,最后用 Levenberg-Marquardt 在完整运动学模型上精化。
GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
该研究提出一种面向地面机器人的表面表示学习方法,通过预测机器人下一时刻状态并引入注意力模块,将新表面类别作为可训练向量加入,实现开放式表面分类。在 Belyaev-Kushnarev 数据集上分类准确率达 98.56%,在 BorealTC 上达 94.8%。
论文提出一套人形机器人拉黄包车的全身控制框架,通过特权教师利用车辆状态、交互力和负载属性训练,再蒸馏为仅依赖本体感受历史的学生策略并做强化学习微调。实机上单一策略完成启动、持续拉动、转向与停止,覆盖刚性负载和真人乘客,无需针对负载重新调参即可拖动最高 115 kg 的负载车,且多数负载-速度条件下机器人归一化运输成本低于空载行走。