北理工团队发布仿生脊柱四足机器人 FLEXOR,动态脊-腿协同使速度提升 31.6%
北京理工大学石青教授团队以象鼩为仿生原型,研制出搭载双关节耦合脊柱的微小型四足机器人 FLEXOR,整机重量 338 克、机身长度 110 毫米,相关长文发表于 Science Advances。
推荐理由:对照实验给出双关节耦合脊柱相对单关节脊柱的速度与能耗差异,可为腿足机器人本体设计提供参考。
北京理工大学石青教授团队以象鼩为仿生原型,研制出搭载双关节耦合脊柱的微小型四足机器人 FLEXOR,整机重量 338 克、机身长度 110 毫米,相关长文发表于 Science Advances。
推荐理由:对照实验给出双关节耦合脊柱相对单关节脊柱的速度与能耗差异,可为腿足机器人本体设计提供参考。
SSR(Selection-based Structured Reasoning)框架将多模态搜索智能体的推理从开放式生成改为从预设可复用的自然语言候选中选择,无需辅助任务头。在七个多模态搜索基准上用 2B 和 4B 模型评测,SSR 在多种强化学习目标与监督微调下,每轮推理时延降低超过 90%,每题总模型推理时延降低 28-54%,平均成功率与同规模领先搜索智能体相当。
在 LoCoMo 与 LongMemEval 上的预注册测试显示,用类型化决策模型 Jev 单次调用选出的原始对话轮次,在紧预算下与 LLM 抽取式记忆非劣(单侧 95% 界 -3.0 分,非劣界 -5 分),且写入成本低 3,061 倍。
中国科学院半导体研究所团队与香港大学团队合作在《Science》发表铁电隧穿结存储器件成果,采用氮化硼势垒层、3R堆叠硫化钼滑移铁电层和单层石墨烯电极,使极化同时调节隧穿势垒高度与参与隧穿的电子数量。
推荐理由:原文拆解了器件结构与双机制协同放大的原理,读者可据此理解读出对比度与耐久性为何此前互相制约。
Skild AI 宣布通过物理自我对弈完成一项后训练突破,其机器人基础模型 S1 在与自身对弈的仿真中学会了踢足球等高度灵巧和动态的任务。模型只被给出进球这一个目标,在 NVIDIA Isaac Sim 中与近期版本的自己对抗,逐步自行学会带球过人、护球和铲球,这些行为因有助于进球而涌现,未手工设计奖励。
推荐理由:原文给出仿真时长、涌现行为和 sim-to-real 迁移结果,可据此评估自我对弈后训练路线在具身智能上的可行性。
Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。
推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。
Skild AI 提出 Omni-bodied Learning,让机器人模型仅通过观看人类视频演示即可学习新技能,只需不到 1 小时的机器人数据微调。该方法针对遥操作数据在多样性与规模上的瓶颈,以及视频缺少力/力矩信号和人机形态差异(Embodiment Gap)等挑战,旨在让基础模型的任务学习具备可扩展性。
南方科技大学CLEAR Lab联合逐际动力、香港大学的论文《Generative Visual Foresight Meets Task-Agnostic Pose Estimation in Robotic Table-top Manipulation》入选CoRL 2025,提出GVF-TAPE算法,让机器人通过观看操作视频预测任务执行过程并学会自主操作。
推荐理由:论文给出LIBERO基准成功率与实机任务结果,可看出纯RGB视频驱动操作训练相比依赖深度相机和动作标注方法的差距。
Figure 宣布 Project Go-Big 与 Helix 的两项进展,包括互联网级人形机器人预训练数据集,以及仅用第一人称人类视频训练后实现零样本人类到机器人的导航迁移。
推荐理由:原文给出用纯第一人称人类视频训练 Helix 实现零样本导航迁移的做法,可作为跨本体数据路线的参考。
Figure AI 公布 Helix 在物流分拣场景的最新进展,包裹处理时间降至约 4.05 秒,条码朝向成功率提升到约 95%,并能处理 poly bag、平信封等可变形包裹。
推荐理由:原文给出 10 到 60 小时演示数据与各模块消融的量化结果,可用来判断数据规模与架构改动各自的收益。
Figure 公布了纯仿真训练的端到端强化学习步行控制器,让 Figure 02 人形机器人以类人步态行走,策略零样本迁移到真机无需微调。训练在 GPU 加速物理仿真中并行运行数千台参数各异的 Figure 02,几小时内积累数年仿真数据,覆盖多种地形、执行器动态变化以及绊倒、打滑和推搡等扰动。
推荐理由:原文给出了用人类步行参考轨迹做奖励先验、再以 kHz 力矩闭环补偿执行器建模误差的做法,可迁移到其他双足训练。