GenZ-LIO:面向受限与开放空间的通用 LiDAR-Inertial 里程计框架
GenZ-LIO 提出一种可泛化的 LiDAR-Inertial 里程计(LIO)框架,通过尺度自适应体素化、混合度量状态更新与体素剪枝对应搜索,适应受限与开放空间之间的尺度变化。
技术方向
AI 走进物理世界的整体进展:整机和基础模型、真实环境部署、量产节点与产业格局的追踪。
145 条精选近 30 天 91 条共收录 707 条
GenZ-LIO 提出一种可泛化的 LiDAR-Inertial 里程计(LIO)框架,通过尺度自适应体素化、混合度量状态更新与体素剪枝对应搜索,适应受限与开放空间之间的尺度变化。
SimToolReal 提出一种以物体为中心的 sim-to-real 强化学习策略,在仿真中程序化生成大量工具类物体原语并训练单一策略,实现测试时无需针对具体物体或任务的训练即可完成灵巧工具操作。
论文提出 QF3(Fast Flow RL with Filtered Q-Gradients),一种在线离策略 RL 算法,通过 flow matching 加上 critic 的动作梯度、经一步预测反向传播来训练流策略,且只将 critic 梯度施加于接近回放动作的那些动作维度。
推荐理由:论文给出相对 FPO++ 的 10x 训练加速和零样本上机结果,可评估该算法是否值得在人形运动控制任务中试用。
DepthWorld 提出一种结合学习式立体深度与联合因子图的标定流程,将 DROID 数据集标定为提供稠密度量深度和多视角外参的 DROID-3D,外部相机在 90% 的 episode 上重投影误差 <0.7 px。
推荐理由:论文解释了RGB-only世界模型几何不一致的成因,并给出可迁移的标定与深度监督思路。
论文提出 Micro Neural Policies(MNP)合成方法,结合 Evolution Strategy(ES)搜索与 Statistical Model Checking(SMC)验证,在不牺牲安全与鲁棒性的前提下大幅压缩神经网络规模。
推荐理由:论文给出策略内存占用与抖动等量化指标,便于评估微型神经策略在 MCU 上的部署可行性。
论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。
推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。
SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。
OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。
推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。
SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。
推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。
论文提出 GaugeBench,把固定机器人改写为物理等价的描述并评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅 51.6,而 98 个真正未见机器人仍有 1489.6。
推荐理由:论文用等价改写描述的对照实验,量化了跨本体评测中被忽略的表示脆弱性,可迁移方法在于其隔离思路。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
一项研究系统评估了 Vanilla BC、LSTM-GMM、IBC、Diffusion Policy 与 VQ-BET 等模仿学习算法在白盒、灰盒和黑盒对抗扰动下的脆弱性。
推荐理由:论文给出白盒与黑盒迁移攻击下的成功率下降幅度,可作为评估模仿学习策略鲁棒性的对照基准。
FlashDexRetarget 提出一种基于强化学习的多参考灵巧重定向框架,用单一策略联合学习多条演示,将重定向优化成本分摊到各参考上。
推荐理由:论文给出与 CHORD 的对比数据,可帮助评估多参考重定向在数据生成成本上的实际收益。
Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。
推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。
研究者构建同一双臂机器人单元的两套仿真版本,对比自建重建(度量尺度物体几何、人工编写物理参数、自建场景 splat)与开源默认重建(生成式单图 mesh、引擎默认物理、Gaussian-splat 场景)对 sim-to-real 评分一致性的影响。
论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。
推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。
论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。
推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。
DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。
推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。
研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。
推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。
论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。
推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。