AHEAD 提出潜空间预测世界模型,让 VLA 处理动态操作任务
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
技术方向
AI 走进物理世界的整体进展:整机和基础模型、真实环境部署、量产节点与产业格局的追踪。
145 条精选近 30 天 91 条共收录 707 条
AHEAD(Anticipatory Horizon Extrapolation with Adaptive Dynamics)提出一种 predict-then-act 包装器,用运动感知的潜空间世界模型预测 VLA 特征空间中的未来 patch token,使冻结的 VLA 能应对执行过程中物体移动的场景。
推荐理由:论文给出 AHEAD 在动态抓取任务上相对基线的成功率对比,可为处理运动物体的 VLA 方案提供参考。
FLASH Policy 用 Legendre 多项式连续轨迹表示替代离散动作块生成,通过稀疏时间采样拟合专家演示,单次推理即可覆盖更长的动作时域。该方法以历史多项式系数而非高斯噪声初始化流匹配,缩短传输距离并支持单步推理,多项式解析求导还可直接为力矩控制器提供速度前馈信号。
推荐理由:用 Legendre 多项式连续轨迹替代离散动作块,配合历史系数初始化流匹配,给出了单步推理与速度前馈的完整实现思路。
Zhou Fang 等提出 ProbeFlow,一种面向 VLA 模型的免训练自适应推理框架,通过初始与前瞻速度向量的余弦相似度评估轨迹复杂度并动态调度积分步数,以剪枝冗余网络评估。
推荐理由:原文给出用速度向量余弦相似度动态调度积分步数的方法,可迁移到其他 Flow Matching 动作头的推理加速。
该研究提出一种免导数的 episodic 潜在策略改进方法,通过将初始噪声采样替换为精心选择的常量噪声向量(golden ticket),改进冻结的 diffusion 或 flow matching 策略。
RealtimeWAM 提出一步动作生成与异步推理的 World Action Model,针对动作专家内部多步去噪和视频与动作专家串行等待两个瓶颈。
推荐理由:论文用一致性蒸馏加跨专家流水线压缩 WAM 推理,给出的加速比和精度损失数据可为实时机器人策略选型提供参考。
论文提出 Object-Grounded Attention Monitoring(OGAM),把系统化测试与运行时保障连接起来,用成功与失败执行间的注意力差异信号在故障完全展开前停止执行。
推荐理由:论文给出注意力偏离信号配合 DTW 与 conformal 校准的早停阈值设定方法,可迁移到其他 VLA 策略的运行时监控。
一篇将发表于 ASPLOS '27 的论文对 4 个代表性 VLA 模型在边缘 GPU 服务器和两款车载 SoC 上做了单次推理剖析与 43,200 次闭环实验。结果显示动作张量维度决定各阶段是内存受限还是算力受限,平台平衡会改变瓶颈位置,GPU 频率调节存在平台相关的能耗-时延最优区间。闭环运行中推理与动作执行重叠会带来精度-速度-能耗权衡,没有一种配置在各类部署 SLO 下都占优。
推荐理由:论文给出 VLA 模型在 batch-1 控制场景下的内存与算力瓶颈判定依据,可为模型、硬件与运行时联合设计提供参考。
AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。
推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。
该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。
推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。
Mulligan 将初始状态分布作为决策变量,每轮从已观察到的失败状态和未尝试状态开始采集,以提升固定监督采集预算下的数据效率。论文在 2,550 个盲测留出回合的三个真实任务和两个仿真任务上评估,相比均匀初始状态采样表现更好;结合基于价值函数的动作选择后,HiL-IDQL+Mulligan 在真实任务上最终成功率提升 10-34 个百分点。在操作员介入下,人机协作完成 98% 的采集回合。
推荐理由:论文给出在固定采集预算下按失败状态分配初始状态分布的做法,做数据采集策略的团队可参考其对比设计。
VICON 提出视觉-惯性-接触手物跟踪框架,通过改造视觉惯性手套并按人类抓握频率布置 FSR 力敏电阻,同步记录接触状态与标定法向力,配合 RGB-D 相机与单目视频重建网格、基于因子图的物体轨迹估计,在严重遮挡下联合捕捉手物运动与接触信息。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。
TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。
推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。
FireDome 推出自主地面发射系统,通过发射含水或阻燃剂的弹丸(最远 1,000 ft.)在野火到达前铺设阻燃隔离带、覆盖建筑并扑灭飞火引发的点火点。系统采用机械发射柔性智能弹丸,每枚约装 10 gal. 液体,在近地面高度展开形成椭圆覆盖区,三层防御分别对应外围隔离带、建筑覆盖和点火点扑灭,默认自主运行并可远程关停,计划与加州消防指挥体系集成。
推荐理由:文章拆解了发射器与三层防御逻辑,可了解自主灭火系统如何嵌入现有消防指挥体系。
ESP Mini App Platform 0.4.9 Beta 开放发布,面向 ESP-Mosaico 开发板(主控 ESP32-S31),系统与应用分离,支持安装、更新、卸载独立应用。
Meta 开源了 Muse Gadgets 硬件开发套件,包含乐鑫ESP32固件和 Linux SDK,开发者可用几十元的 ESP32 开发板或树莓派为个人桌面 AI Agent Muse 制作物理外设,实现智能家居控制、日程提醒等功能。
推荐理由:原文给出了硬件BOM成本、固件与Linux SDK分工和刷写绑定流程,想自制Muse外设的开发者可据此评估上手成本。
机器人大讲堂分析认为,机器人产业最先跑通的落地场景可能在体育场、主题乐园和城市广场,而非工厂或家庭。据其不完全统计,4 月至 9 月底机器人赛事覆盖五个主要城市、五种赛制,参赛机器人总数超过 2200 台,其中第二届世界人形机器人运动会有 2056 台机器人同场竞技,赛项从 19 个扩到 50 个。
推荐理由:原文梳理了五座城市机器人赛事的规模与出货数据,可用来理解文体旅场景为何先于工厂和家庭形成落地。
高工机器人统计近20家电机相关上市公司2025年年报,步科股份、雷赛智能、鸣志电器、兆威机电等均在机器人领域布局电机产品,短期产业共识集中于无框力矩电机用于大关节、空心杯电机用于灵巧手。
推荐理由:原文按无框力矩电机和空心杯电机两条路线梳理近20家上市公司布局,可用来对照各家量产进度与营收兑现差异。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。
FCC 于 7 月将外国产先进机器人设备列入构成国家安全或安全风险的清单,新设备无法获得进口、在美销售所需的 FCC 认证,涵盖人形与四足等可采集环境信息的移动机器人。
推荐理由:文章梳理了FCC限制如何从采购传导到机器人架构选择,对评估本地推理与供应链策略有参考价值。