跳到正文
10月7日周三
  1. arXiv cs.RO 机器人学49

    PerturBot:用扰动训练打破视觉-语言-动作模型的捷径先验

    PerturBot 通过任务保持的腕部视角扰动、决策相关字幕增强指令,以及随机与失败轨迹片段重标注,削弱视觉-语言-动作(VLA)策略对模态捷径的依赖,且不改变推理过程。配套提出的 GroundingFscore 是一种离线评分,用于诊断策略对模态捷径的依赖程度,与任务成功率结合可判断策略是否健康扩展。

  2. arXiv cs.RO 机器人学53

    FLTA:面向人到机器人视觉适应的帧级时间对齐框架

    FLTA 框架通过全局进度先验与局部时序顺序先验,无需帧级对应标注即可学习共享任务进度表示,解决人与机器人演示执行速率和非关键帧比例差异导致的对应学习失败问题。在 ResNet-50 与 ViT 编码器上,平均仿真成功率较最佳基线分别提升 46.93% 与 65.96%,并在真实操作任务上取得更高成功率。结果表明人机适应效果更取决于选择更新哪些参数,而非更新参数数量。

  3. arXiv cs.RO 机器人学53

    GiT:面向机器人操作时序定位的多源数据集与基准

    GiT(Grounded in Time)发布了一个面向机器人操作的多源数据集与基准,用于将操作决策定位到过去事件,覆盖生物实验室、家庭与工业场景。数据集包含真实机器人与 Universal Manipulation Interface(UMI)风格演示共 18 个双臂任务,以及基于 ManiSkill 的 9 个任务仿真评测套件,并提供细粒度子任务标注与反事实任务对。

  4. arXiv cs.RO 机器人学58

    人形机器人全身运动持续学习:Similarity-guided LoRA-PNN 防止灾难性遗忘

    提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。

  5. The Robot Report58

    TwelveLabs 发布 Pegasus 1.6 视频理解模型,面向物理 AI 与第一人称视频

    TwelveLabs 发布 Pegasus 1.6 模型,面向机器人、无人机和自动驾驶等物理 AI 场景,是其首个面向第一人称视频的 AI 模型,不依赖特定相机或专有硬件。

    推荐理由:原文列出了五项工作流和第一人称视频定位,做机器人数据管线的团队可据此判断是否接入。

10月6日周二
  1. arXiv cs.RO 机器人学51

    TACET:面向四足机器人的上下文自适应声学-社会导航

    TACET 提出一种上下文自适应声学-社会导航方法,让四足机器人从第一人称视角推断社会场景,同时决定行走位置与移动音量。该方法用单一行为 token 耦合微调视觉-语言推理器与快速反应控制器,同时约束社会代价地图与安静运动策略,并以视野外记忆保留离开相机视野的行人。

  2. arXiv cs.RO 机器人学54

    Reward-DAgger:基于通用进度奖励模型的机器人门控交互式模仿学习

    Reward-DAgger 提出一种机器人门控交互式模仿学习框架,用通用奖励模型的稠密进度信号判断何时需要人类介入,无需访问策略内部结构,也不用按任务重新调参。在 8 个仿真与真实任务中,其失败检测精度-时延权衡优于现有运行时监控基线,并持续提升下游策略的自主成功率与人力回报。同一门控配置跨任务、环境与策略架构通用,代码与视频已开源。

  3. arXiv cs.RO 机器人学55

    REDIRECT:用 1% 训练预算修复机器人坏习惯

    REDIRECT 仅用 1% 的全训练样本反向预算,即可修复机器人从少量缺陷遥操作演示中学到的坏习惯,无需帧级标注或额外交互。在三个 ManiSkill 随机化任务上,REDIRECT 将平均成功率从 68.2% 提升至 90.3%,恢复 88.8% 的干净重训练差距,而同算力微调仅恢复 22.1%。在 PiPER 机械臂的杯子插入与毛巾折叠任务上,它恢复 86.7-92.9% 的差距。

  4. arXiv cs.RO 机器人学54

    GOTT:基于可复用跨具身原语的物体中心灵巧操作

    GOTT 提出 reach-acquire-move 框架,用单一跨具身接触获取原语把机器人无关的物体轨迹转化为多指手行为:先将手带到任务相关接触区域,再由共享闭环原语建立稳定接触,位姿条件控制器跟踪物体运动。仿真与真实实验显示 GOTT 能在多种物体、臂-手平台及已见与未见手部形态上建立鲁棒接触,并一致提升端到端任务成功率。

10月5日周一
  1. 机器人大讲堂56

    东京初创MW把天花板轨道机械臂装进住宅,2亿日元起售,机器人版2028年上市

    东京初创公司MW把沿天花板轨道滑动的双臂机械臂MW bot集成进住宅,首批不含机器人版本定价2亿~4亿日元,已在东京、横滨、福冈推进项目,搭载机器人的版本计划2028年上市。

    推荐理由:文章拆解了MW把机械臂集成进住宅的路线选择,以及它与双足人形方案在安全、算力和心理感受上的取舍。

10月3日周六
10月1日周四
  1. 波士顿动力博客72

    波士顿动力发布 Atlas 新一代四指灵巧手,13 自由度直接驱动

    波士顿动力为新一代 Atlas 发布四指灵巧手,共 13 个自由度、直接驱动,尺寸接近大型人手且平均力量更强,可搬运装满 100lb+ 的小冰箱。手部配备覆盖指尖和掌面的密集压力触觉传感器,关节可反向驱动以实现本体感知,支持捏取、三指抓握和握持电钻、射钉枪、焊枪等带扳机工具。

    推荐理由:原文解释了四指 13 自由度设计如何在灵巧性、强度与量产成本之间取舍,可为同类末端执行器选型提供参考。

9月30日周三
  1. 机器人大讲堂68

    AMD 82亿美元收购World Labs,国内4D世界模型路线分化

    AMD以约82亿美元全股票交易收购World Labs,李飞飞将加入AMD任执行副总裁兼首席科学家,交易预计2026年底前完成。文章借此梳理国内世界模型的三条路线:腾讯混元偏空间生成,群核科技偏空间数据与仿真训练,影身智能从多视角真实4D数据切入,经4D重建、世界模型到真机执行闭环。

    推荐理由:原文把AMD收购World Labs与国内三条世界模型路线并置,可用来理解4D世界模型从数据到产线的落地差异。

  2. 机器人大讲堂71

    智元100台灵犀X2进驻爱仕达门店,三天直播销售225.3万元

    智元与炊具品牌爱仕达合作落地,100台灵犀X2人形机器人进入爱仕达全国100家门店担任促销员,覆盖六十多个城市。双方在温岭、上海、无锡三地开展为期三天、每天10小时的直播,百店累计销售金额达225.3万元,带动门店业绩增长39%。

    推荐理由:原文给出三天直播的销售金额与增长比例,并拆解了机器人与真人导购的分工边界,可作为零售部署的验收参照。

9月23日周三
  1. Skild AI 博客64

    Skild AI 用物理自我对弈后训练 S1,让机器人在仿真中学会踢足球并迁移到人形机器人

    Skild AI 宣布通过物理自我对弈完成一项后训练突破,其机器人基础模型 S1 在与自身对弈的仿真中学会了踢足球等高度灵巧和动态的任务。模型只被给出进球这一个目标,在 NVIDIA Isaac Sim 中与近期版本的自己对抗,逐步自行学会带球过人、护球和铲球,这些行为因有助于进球而涌现,未手工设计奖励。

    推荐理由:原文给出仿真时长、涌现行为和 sim-to-real 迁移结果,可据此评估自我对弈后训练路线在具身智能上的可行性。

9月17日周四
  1. Figure AI 新闻78

    Figure 发布 Helix 2.5,实现 30 个陌生家庭零样本全身作业泛化

    Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。

    推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。

  2. IEEE Spectrum · Robotics57

    AI 时代重新思考机器人安全:三层攻击面与全生命周期保障

    机器人安全正从"故障时是否安全"转向"攻击者篡改感知与决策时是否安全",训练后门、系统漏洞与运行时感知操纵构成三层攻击面。NeurIPS 2025 的 BadVLA 针对 VLA 模型植入后门,GoBA 以咖啡杯等日常物品为触发器实现 97% 攻击成功率;UniPwn 利用硬编码密钥与命令注入可"蠕虫式"扩散至整机队。

9月10日周四
  1. Skild AI 博客75

    Skild AI 年度经常性收入突破 1000 万美元后达 1 亿美元,创始人阐述部署优先策略

    Skild AI 在首次商业部署十个月后年度经常性收入突破 1 亿美元,其中约 90% 来自操作类任务,移动类占 10%,已积累 60 多家付费客户。公司正与 NVIDIA 和 Foxconn 合作,在双臂机械手上部署 Skild Brain 用于 NVIDIA Blackwell 系统的高精度装配,并在住友电装推进 S1 用于线束制造,与三井物产在商用厨房试点通用机器人。

    推荐理由:原文给出十个月60多家付费客户的收入结构与部署案例,可看出具身智能商业化在操作类任务上的落地分布。

8月25日周二
  1. Figure AI 新闻66

    Figure AI 发布机器人训练数据集 Index,累计采集超 1600 万条视频

    Figure AI 发布机器人训练数据集 Index,配套 App 已在 Google Play 与 App Store 上线,累计下载 264,000 次、覆盖 108 个国家,Creator 上传超 1600 万条视频,每秒处理 30 分钟视频上传。

    推荐理由:原文披露了每千小时数据的任务与物体多样性指标,以及五阶段数据管线,可作为机器人数据采集规模化的参考。

8月18日周二
  1. Skild AI 博客76

    Skild AI 发布机器人基础模型 S1,用单段视频提示完成未见长程任务

    Skild AI 发布旗舰机器人基础模型 S1,作为上下文学习器,仅凭一段视频演示即可执行未在预训练中出现、最长 10 分钟的操作任务,无需微调或后训练。在内部基准上,未见任务中 ICL 在 100k 小时预训练数据下达到 66% 成功率,语言提示 VLA 为 9%;已见任务中 S1 达到约 96%。一次上下文演示约等于 380 个后训练示例,植物移盆任务从演示到自主执行用时 11 分钟。

    推荐理由:原文给出 ICL 与语言提示 VLA 在 1k 到 100k 小时预训练下的成功率对比,可作为评估提示范式选型的参考。

7月15日周三
  1. 逐际动力官网新闻66

    逐际动力发布 COSA 0.5 的人形 VLA 技术栈 V³-0

    逐际动力随 COSA 0.5 发布 V³-0,即机器人 OS COSA 中 VLA-tools 层的首个版本,支持移动全身操作的人形 VLA 技术栈。V³-0 运行在 43 自由度的人形机器人 Oli 上,多级架构让感知、决策与执行在不同时间尺度协同运行,LimX-WBT 跟踪全身目标并维持动态平衡,统一移动与操作。

    推荐理由:原文给出 V³-0 的多级架构与人类在环真机强化学习闭环,可作为人形 VLA 技术栈设计的参考。

7月14日周二
  1. 逐际动力官网新闻66

    逐际动力完成近2亿美元 Pre-IPO 轮融资,半年累计融资4亿美元

    逐际动力宣布完成 Pre-IPO 轮融资,融资金额近2亿美元,过去半年累计完成融资4亿美元。本轮投资方包括IDG资本、蓝思科技、GGG Group、华山资本、合肥滨湖产发集团等,阿联酋磊石资本连续追投,绿洲资本、基石资本、蔚来资本等老股东超额加注。

    推荐理由:本轮资金用途点出大小脑融合技术产品化与数千台人形机器人规模化部署,可看出其下一步投入重点。

6月30日周二
6月17日周三
  1. Sanctuary AI 新闻64

    Sanctuary AI 在 Tier 1 汽车供应商产线验证 Physical AI,线缆插装任务成功率超 99.5%

    Sanctuary AI 宣布其 Physical AI 在一家全球 Tier 1 汽车供应商的复杂线缆插装任务上达到 99.5%+ 的任务成功率,节拍时间 2.54 秒,并通过客户实际产线基准验证。

    推荐理由:原文给出了线缆插装任务的 99.5%+ 成功率与 2.54 秒节拍,可作为柔性物料自动化落地的参考基准。

6月4日周四
  1. 波士顿动力博客56

    波士顿动力 Atlas 能否通过足球学会运动?

    波士顿动力与现代合作,用人类示范和强化学习训练 Atlas 人形机器人完成此前未见的 Ghost Rabona 花式踢球动作。团队用光学动作捕捉记录球员与工程师 Roberto 的高保真运动数据,经重定向映射到 Atlas 运动学结构后,在云端 GPU 并行数千次仿真训练,相当于 24 小时内完成一年的物理试错,学到的策略几乎全部首次上机即成功。该训练方法可迁移到仓储、工厂等实际作业任务。

5月8日周五
  1. Figure AI 新闻72

    Figure 两台 Helix-02 人形机器人协作在两分钟内整理卧室

    Figure 演示两台 Helix-02 人形机器人在两分钟内协作完成卧室整理,包括开门、挂衣服、收耳机、合书、倒垃圾、推椅子和共同铺床。两台机器人共用一个学习得到的 Vision-Language-Action 策略,没有共享规划器、消息传递或中央协调器,各自通过相机读取场景并仅凭动作推断对方意图。

    推荐理由:原文给出了双机器人协作的实现方式,即无共享规划器、仅靠各自相机推断对方意图,可作为多智能体操作的参考。

4月30日周四
  1. 逐际动力官网新闻67

    逐际动力开源 FluxVLA Engine,标准化 VLA 工程底座打通数据到真机部署全流程

    逐际动力正式开源 FluxVLA Engine,一个面向具身智能的标准化 VLA 工程底座,以统一配置、标准接口、模块解耦和加速部署为核心,打通数据处理、模型训练、仿真评测到真机部署全流程。

    推荐理由:统一配置与模块解耦的设计思路,对需要在多个数据集和硬件平台间复用 VLA 训练流程的团队有参考价值。

4月29日周三
4月15日周三