跳到正文

内容形态

论文研究 最新动态

值得读的嵌入式与机器人论文:操作泛化、运动控制、端侧推理效率与新基准的精选。

71 条精选近 30 天 57 条共收录 665 条

更新

精选归档 · 第 2 页

10月7日周三第 21–40 条
  1. arXiv cs.RO 机器人学58

    论文提出紧凑操作策略 CoRP,论证细粒度视觉表征的关键作用

    论文提出紧凑操作策略 CoRP(48.9M 参数,不含视觉语言模型和视频生成先验),在 LIBERO 达到 97.0%,在 RoboTwin 2.0 Clean/Randomized 分别达到 75.78%/73.36%,匹配大 40.9-163.6 倍的系统。

    推荐理由:论文用逐项消融拆解了视觉表征各因素对操作策略性能的贡献,便于评估模型规模与预训练先验的实际作用。

  2. arXiv cs.RO 机器人学58

    SALT:让 VLA 模型在执行中适应未知视觉干扰

    SALT 用上一动作块未执行的 leftover 轨迹作为自监督信号,在测试时对 VLA 策略做适应,无需干扰标注、专家动作或目标域演示。在 LIBERO-10 上,SALT 将 SmolVLA 在五种持续视觉干扰下的平均成功率从 43.9% 提升到 53.2%,GR00T N1.7 从 58.7% 提升到 66.0%。真机实验中,任务进度从 0.49 提升到 0.61。

  3. arXiv cs.RO 机器人学59

    OpenWAM:面向可组合世界-动作模型的开放框架

    OpenWAM 提出一个开放的世界-动作建模(WAM)框架,以 Wan2.2-5B 为起点在超过 10,000 小时视频上做因果机器人视频预训练,并通过共享 Mixture-of-Transformers 架构接入动作专家,支持联合、先视频后动作、先动作后视频和解耦四种生成方式。

    推荐理由:论文给出了各交互设计在同一测试床上的对比数字,便于评估反事实数据对动力学学习的增益。

  4. arXiv cs.RO 机器人学58

    SMART:大规模合成预训练实现关节物体操作的零样本 sim-to-real 迁移

    SMART 提出面向关节物体操作的大规模合成演示预训练系统,其 SMART-Sim 仿真平台具备关节感知设计,可生成任务并高效采集演示,最终合成的 SMART-Data 覆盖 44 类原子任务、5 种机器人配置和 2,507 个关节物体,共超过 1M 条演示。基于该数据预训练的 VLA 模型在仿真基准上表现具备竞争力,并在真实世界的关节物体操作任务中实现零样本 sim-to-real 迁移。

    推荐理由:论文给出合成演示数据的规模与零样本迁移结果,可评估合成预训练在关节物体操作上的可行性。

  5. arXiv cs.RO 机器人学58

    GaugeBench 揭示形态感知策略对机器人描述的表示脆弱性

    论文提出 GaugeBench,把固定机器人改写为物理等价的描述并评测同一策略权重,发现三个 MetaMorph 策略在 80 个熟悉机器人上得分 4030.6,等价重描述后仅 51.6,而 98 个真正未见机器人仍有 1489.6。

    推荐理由:论文用等价改写描述的对照实验,量化了跨本体评测中被忽略的表示脆弱性,可迁移方法在于其隔离思路。

  6. arXiv cs.RO 机器人学62

    NTNU 提出可在单核 MCU 上运行的雷达惯性里程计

    NTNU 团队提出面向低算力平台的嵌入式雷达惯性估计器,所有传感器驱动、数据处理与辅助惯性导航均在单核 MCU 上运行。飞行实验显示相对动捕的平移 APE 为 0.51-0.82 m、RPE 低于 3%,并完成基于未修改 PX4 栈的闭环飞行;固件与 PCB 设计已在 GitHub 的 ntnu-arl/embedded_rio 和 ntnu-arl/embedded_rio-pcb 开源。

    推荐理由:论文给出单核 MCU 上的完整实现与实测误差区间,可评估其在算力受限平台替代视觉方案的可行性。

  7. arXiv cs.RO 机器人学60

    Flash-WAM 提出模态感知步蒸馏,将世界动作模型推理压缩到单步

    Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。

    推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。

  8. arXiv cs.RO 机器人学58

    Real2Sim2Real 协同训练研究拆解世界对齐与行为对齐对灵巧操作策略的影响

    Samuel Liu 等人构建 real2sim2real 流水线,将世界对齐与行为对齐作为两个独立变量,研究二者对协同训练策略性能的影响。在动态灵巧抓取分拣任务上,完全对齐的协同训练把成功率从 52% 提升到 86%;跨配置平均,世界对齐提升 18 个百分点,行为对齐提升 10 个百分点。

    推荐理由:论文把世界对齐与行为对齐拆成两个独立变量,给出各自对成功率的贡献幅度,做仿真协同训练的人可据此分配数据投入。

  9. arXiv cs.RO 机器人学58

    面向实时 VLA 的两阶段非均匀去噪与系统级评测

    论文针对 VLA 模型低速率推理与机器人高速率执行之间的时间差,测量了模型推理与机器人执行链的端到端时延,并提出两阶段非均匀去噪,将去噪步数从 10 步减到 2 步、模型推理时间从 61.557 ms 降到 21.956 ms。

    推荐理由:论文给出两步去噪把推理时间从 61.557 ms 降到 21.956 ms 的实测数据,可为 VLA 实时化优化提供参考。

  10. arXiv cs.RO 机器人学58

    UMR 提出统一操作表示,实现人类演示到异构机器人的零样本技能迁移

    论文提出 Universal Manipulation Representation(UMR),把操作分解为与本体无关的 World Flow 和相对当前位姿的 Ego Trajectory 两部分,实现人类演示到异构机器人的零样本技能迁移。

    推荐理由:论文给出统一动作表示的几何分解思路,跨本体迁移的方法设计对做 VLA 策略的研究者有参考价值。

  11. arXiv cs.RO 机器人学58

    DEXTERA 提出从单张图像到可部署灵巧操作的 Real-to-Sim-to-Real 框架

    DEXTERA 提出一套自动化的 real-to-sim-to-real 框架,可将单张 RGB 图像转化为可部署的灵巧操作策略,覆盖场景分解、度量对齐、任务原语构建与多模态策略接口四个阶段。

    推荐理由:论文给出从单张 RGB 图像自动生成可部署灵巧操作策略的完整流程,并报告仿真与真实协同训练带来的成功率变化。

  12. arXiv cs.RO 机器人学62

    EgoSteer 开源全栈系统:从第一人称视频实现可引导的灵巧操作

    研究团队发布开源全栈系统 EgoSteer,用第一人称人类视频扩展灵巧手 VLA 预训练,并以少量真实机器人数据完成后训练。

    推荐理由:论文给出从第一人称视频构建 9606 小时预训练数据的完整管线,做灵巧手数据工程的团队可对照其吞吐与精度做法。

  13. arXiv cs.RO 机器人学58

    SVA 框架将树搜索蒸馏为动作评估器,提升冻结 VLA 模型的泛化能力

    论文提出 SVA(Search, Value, and Act)框架,用 Monte-Carlo tree search 在仿真中探索冻结 VLA 的输出分布并收集带经验回报的轨迹,再蒸馏成轻量 Q 值模型,部署时由评估器从多个候选动作中选出不确定性正则化 Q 值最高者,无需仿真器。

    推荐理由:论文用 pass@k 诊断说明冻结 VLA 输出分布里已有可用行为,把树搜索蒸馏成 Q 值评估器可在不改骨干的前提下提升成功率。

  14. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  15. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  16. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。