RLHND:用视频基础模型从第一人称视频同时估计手部位姿与触觉
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
RLHND 提出一种基于视频基础模型的手部跟踪模型,从单目第一人称视频中联合估计手部位姿与真实触觉信息。它把预训练的 Cosmos 3 视频扩散主干通过 clean-latent 条件化改造成确定性的片段级特征提取器,位姿流预测解剖学上合理的关节角度并支持形状参数条件化,触觉流在位姿流冻结下预测手表面的密集接触与力。
推荐理由:论文说明了用视频基础模型补上接触与力线索的思路,关注人视频用于机器人策略训练的读者可了解其方法路径。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。
推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
推荐理由:论文给出与 RoboDawn 和直接 Astra 的对照成功率,便于评估冻结模型下递归自改进的实际增益。
UCLA、MIT和加州大学戴维斯分校团队在《Science Robotics》发表一款185毫克全聚合物微型扑翼飞行机器人,去掉传统传动机构,靠电致伸缩弯曲驱动器直接带动柔性锥形机翼。
推荐理由:论文给出驱动器功率密度、升重比和压缩后升力保留率,可作为柔性抗冲击设计的量化参考。
Sanctuary AI 提出 TIGER(Task-Space Imitation Guidance for Efficient Reinforcement learning),把模仿策略当作稠密奖励信号而非控制器来引导强化学习。
推荐理由:原文给出把模仿策略转为稠密奖励的具体做法与消融结果,可参考其降低真机安全重置次数的思路。
北京理工大学石青教授团队以象鼩为仿生原型,研制出搭载双关节耦合脊柱的微小型四足机器人 FLEXOR,整机重量 338 克、机身长度 110 毫米,相关长文发表于 Science Advances。
推荐理由:对照实验给出双关节耦合脊柱相对单关节脊柱的速度与能耗差异,可为腿足机器人本体设计提供参考。
中国科学院半导体研究所团队与香港大学团队合作在《Science》发表铁电隧穿结存储器件成果,采用氮化硼势垒层、3R堆叠硫化钼滑移铁电层和单层石墨烯电极,使极化同时调节隧穿势垒高度与参与隧穿的电子数量。
推荐理由:原文拆解了器件结构与双机制协同放大的原理,读者可据此理解读出对比度与耐久性为何此前互相制约。
Skild AI 宣布通过物理自我对弈完成一项后训练突破,其机器人基础模型 S1 在与自身对弈的仿真中学会了踢足球等高度灵巧和动态的任务。模型只被给出进球这一个目标,在 NVIDIA Isaac Sim 中与近期版本的自己对抗,逐步自行学会带球过人、护球和铲球,这些行为因有助于进球而涌现,未手工设计奖励。
推荐理由:原文给出仿真时长、涌现行为和 sim-to-real 迁移结果,可据此评估自我对弈后训练路线在具身智能上的可行性。
作者结合 Linux 内核收到 AI 生成的 prom21-xhci 驱动补丁和 EmbedAgent(ICSE 2026,arXiv:2506.11003)基准,分析 AI 在嵌入式开发中的实际边界。
推荐理由:原文结合内核补丁案例与 EmbedAgent 基准数据,给出可直接对照的 AI 分工清单,便于工程师判断哪些活可交出去。
Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。
推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。
Figure AI 发布机器人训练数据集 Index,配套 App 已在 Google Play 与 App Store 上线,累计下载 264,000 次、覆盖 108 个国家,Creator 上传超 1600 万条视频,每秒处理 30 分钟视频上传。
推荐理由:原文披露了每千小时数据的任务与物体多样性指标,以及五阶段数据管线,可作为机器人数据采集规模化的参考。
Skild AI 发布旗舰机器人基础模型 S1,作为上下文学习器,仅凭一段视频演示即可执行未在预训练中出现、最长 10 分钟的操作任务,无需微调或后训练。在内部基准上,未见任务中 ICL 在 100k 小时预训练数据下达到 66% 成功率,语言提示 VLA 为 9%;已见任务中 S1 达到约 96%。一次上下文演示约等于 380 个后训练示例,植物移盆任务从演示到自主执行用时 11 分钟。
推荐理由:原文给出 ICL 与语言提示 VLA 在 1k 到 100k 小时预训练下的成功率对比,可作为评估提示范式选型的参考。
波士顿动力与现代合作,用人类示范和强化学习训练 Atlas 人形机器人完成此前未见的 Ghost Rabona 花式踢球动作。团队用光学动作捕捉记录球员与工程师 Roberto 的高保真运动数据,经重定向映射到 Atlas 运动学结构后,在云端 GPU 并行数千次仿真训练,相当于 24 小时内完成一年的物理试错,学到的策略几乎全部首次上机即成功。该训练方法可迁移到仓储、工厂等实际作业任务。
Dexterity 公开其物理 AI 世界模型 Foresight,该模型基于生产环境中超过 1 亿次自主动作的经验训练,面向企业物流场景的安全关键型机器人应用。
推荐理由:原文给出世界模型在生产环境的训练规模与决策时延,可据此了解工业操作场景对世界模型的可解释与实时要求。
Skild AI 提出 Omni-bodied Learning,让机器人模型仅通过观看人类视频演示即可学习新技能,只需不到 1 小时的机器人数据微调。该方法针对遥操作数据在多样性与规模上的瓶颈,以及视频缺少力/力矩信号和人机形态差异(Embodiment Gap)等挑战,旨在让基础模型的任务学习具备可扩展性。
南方科技大学CLEAR Lab联合逐际动力、香港大学的论文《Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-top Manipulation》入选CoRL 2025,提出GVF-TAPE算法,让机器人通过观看操作视频预测任务执行过程并学会自主操作。
推荐理由:论文给出LIBERO基准成功率与实机任务结果,可看出纯RGB视频驱动操作训练相比依赖深度相机和动作标注方法的差距。
Figure 宣布 Project Go-Big 与 Helix 的两项进展,包括互联网级人形机器人预训练数据集,以及仅用第一人称人类视频训练后实现零样本人类到机器人的导航迁移。
推荐理由:原文给出用纯第一人称人类视频训练 Helix 实现零样本导航迁移的做法,可作为跨本体数据路线的参考。
Figure 的 VLA 模型 Helix 在折叠衣物、分拣包裹之后,又学会了装载洗碗机,全程没有新算法和专门工程,只补充了新数据。Helix 能把堆叠的盘子逐一分离并按顺序放入,用一只手拿起玻璃杯、调整姿态后由另一只手小心放置,还能应对杂乱的初始摆放,并从误抓或碰撞中恢复。Figure 表示这说明同一套通用架构可以覆盖差异很大的日常任务,是向可扩展的通用人形智能再进一步。
推荐理由:同一套 Helix 模型仅靠新增数据就学会装洗碗机,可看出通用架构跨任务复用的落地路径。