跳到正文

技术方向

具身智能 最新动态

AI 走进物理世界的整体进展:整机和基础模型、真实环境部署、量产节点与产业格局的追踪。

145 条精选近 30 天 91 条共收录 707 条

更新

精选归档 · 第 3 页

10月7日周三第 41–60 条
  1. arXiv cs.RO 机器人学58

    AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务

    AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。

    推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。

  2. arXiv cs.RO 机器人学58

    FLASH Policy 用稀疏采样与 Legendre 多项式实现高效视觉运动策略

    FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。

    推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。

  3. arXiv cs.RO 机器人学58

    ProbeFlow 提出免训练自适应 Flow Matching 推理框架,加速 VLA 模型动作解码

    Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。

    推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。

  4. arXiv cs.RO 机器人学58

    OGAM 论文提出基于物体注意力监控的 VLA 策略运行时保障方法

    论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。

    推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。

  5. arXiv cs.RO 机器人学58

    研究刻画 VLA 工作负载特性,指导具身 AI 系统设计

    一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。

    推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。

  6. arXiv cs.RO 机器人学59

    AffordCraft 用单张 RGB 图像检索构建任务可用的仿真资产

    AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。

    推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。

  7. arXiv cs.RO 机器人学58

    研究揭示 VLA 机器人策略存在视觉接地缺口,任务成功未必遵循指令

    该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。

    推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。

  8. arXiv cs.RO 机器人学58

    Mulligan 提出面向机器人在机学习的性能引导数据采集方法

    Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。

    推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。

  9. arXiv cs.RO 机器人学58

    人形机器人全身运动持续学习:Similarity-guided LoRA-PNN 防止灾难性遗忘

    提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。

  10. The Robot Report58

    TwelveLabs 发布 Pegasus 1.6 视频理解模型,面向物理 AI 与第一人称视频

    TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。

    推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。

  11. The Robot Report57

    FireDome 打造自主野火防御发射系统

    FireDome 推出自主地面发射系统,通过发射含水或阻燃剂的弹丸(最远 1,000 ft.)在野火到达前铺设阻燃隔离带、覆盖建筑并扑灭飞火引发的点火点。系统采用机械发射柔性智能弹丸,每枚约装 10 gal. 液体,在近地面高度展开形成椭圆覆盖区,三层防御分别对应外围隔离带、建筑覆盖和点火点扑灭,默认自主运行并可远程关停,计划与加州消防指挥体系集成。

    推荐理由:文章拆解了发射器与三层防御逻辑,可了解自主灭火系统如何嵌入现有消防指挥体系。

10月6日周二
  1. IoT物联网技术64

    Meta 开源 Muse Gadgets 硬件开发套件,适配 ESP32 与树莓派

    Meta 开源了 Muse Gadgets 硬件开发套件,包含乐鑫ESP32固件和 Linux SDK,开发者可用几十元的 ESP32 开发板或树莓派为个人桌面 AI Agent Muse 制作物理外设,实现智能家居控制、日程提醒等功能。

    推荐理由:原文给出了硬件BOM成本、固件与Linux SDK分工和刷写绑定流程,想自制Muse外设的开发者可据此评估上手成本。

  2. 机器人大讲堂58

    机器人大讲堂分析文体旅赛事成为机器人产业落地最快场景

    机器人大讲堂分析认为,机器人产业最先跑通的落地场景可能在体育场、主题乐园和城市广场,而非工厂或家庭。据其不完全统计,4 月至 9 月底机器人赛事覆盖五个主要城市、五种赛制,参赛机器人总数超过 2200 台,其中第二届世界人形机器人运动会有 2056 台机器人同场竞技,赛项从 19 个扩到 50 个。

    推荐理由:原文梳理了五座城市机器人赛事的规模与出货数据,可用来理解文体旅场景为何先于工厂和家庭形成落地。

  3. 高工机器人64

    近20家电机上市公司布局人形机器人,无框力矩电机与空心杯电机成主流路线

    高工机器人统计近20家电机相关上市公司2025年年报,步科股份、雷赛智能、鸣志电器、兆威机电等均在机器人领域布局电机产品,短期产业共识集中于无框力矩电机用于大关节、空心杯电机用于灵巧手。

    推荐理由:原文按无框力矩电机和空心杯电机两条路线梳理近20家上市公司布局,可用来对照各家量产进度与营收兑现差异。

  4. Hugging Face 每日论文60

    PhysEvo:围绕冻结模型的物理递归自改进框架在 RoboDojo 与真机上评测

    PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。

    推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。

  5. The Robot Report57

    FCC 对外国机器人限制或加速机器人转向本地 AI 架构

    FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。

    推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。