Co²Skill:通过技能组合实现长时程人机环境交互的全身控制
Co²Skill 提出统一策略,将场景交互与灵巧物体操作整合到同一全身控制框架中,基于预训练运动先验并使用任务与阶段相关的观测掩码选择信息。该方法引入目标条件下的 loco-manipulation 课程与跨任务课程,联合训练单项技能和选定任务序列,在任务边界保持物理状态并维持抓取。在坐、站、爬、上下楼梯及目标导向操作等任务上完成评估,并在室内环境中演示了技能组合。
Co²Skill 提出统一策略,将场景交互与灵巧物体操作整合到同一全身控制框架中,基于预训练运动先验并使用任务与阶段相关的观测掩码选择信息。该方法引入目标条件下的 loco-manipulation 课程与跨任务课程,联合训练单项技能和选定任务序列,在任务边界保持物理状态并维持抓取。在坐、站、爬、上下楼梯及目标导向操作等任务上完成评估,并在室内环境中演示了技能组合。
LACE-CRAFT 提出一种机器人协同设计方法,通过 Actor 参数继承与 Blackboard 协作,在形态搜索中复用已有控制经验。在五个运动基准上,其三个评估种子的平均得分较 D2C 高 6.4-91.9%。两种方法均在五轮中训练 30 个新形态-奖励对,LACE 另使用四个续训单元,并通过实物原型演示了室内行走与几何到硬件的工作流。
一项研究评估了两个机器人智能体间协同进化的通信机制从离散 2D 仿真器迁移到具备真实物理的 3D 仿真器后的功能保持情况。结果显示成功率在 2,000 至 6,000 物理步的时间预算内近似线性增长且无平台期,短时评估会低估控制器性能;social cue 在两种仿真器中主要起拥堵辅助作用而非导航引导,8 次独立进化运行显示角色不对称方向一致但幅度各异。
RoboRender 是一个将模拟轨迹转换为照片级 RGB 视频的框架,以模拟深度视频、语言指令和机器人 RGB mask 视频为条件训练面向机器人的视频生成模型,在保留模拟器几何、机器人运动和动作标签的同时合成真实纹理、背景与干扰物。
论文提出 Robo-COP,让 VLM 编排器与 VLA 策略在部署过程中协同演化:从自身执行中整理技能演示,在数据能解决反复失败时微调策略,并在新策略确实提升对应技能后才采纳。
论文提出多物体多目标抛掷(MOMT)的两阶段快速规划框架,离线建模可行集,在线生成可行抛掷动作的序列组合耗时低于 5 ms。在 7-DoF 机械臂配多指手的平台上,仿真中双物体协同抛掷较独立单物体规划缩短执行时间至多 46%,三物体保持该提升;真机双物体实验确认缩短 29%,与理论 50% 的差距来自抛掷间过渡开销。
arXiv 论文提出一种信念空间规划方法,沿评估轨迹预测、传播并惩罚规划器条件化的估计器误差,用仿射误差动力学与矩递推建模间歇随机修正带来的额外不确定性。仿真中对倾转旋翼 VTOL 舰船甲板降落进行滚动时域规划,条件化建模使命令盲 EKF 的误差预测损失相对规划器无关模型降低 13.4%。
一项在 AGX Orin 与 Pololu 3pi+ RP2040 上开展的硬件在环评测显示,任务准入合并能在 48 个条件中的 31 个减少分配器调用与处理器开销,但收益取决于到达强度与分配器类型。
论文提出 Codebook-Aligned Prediction(CAP),将动作分词器学到的码本向量直接用作策略类别原型,替代从零训练的分类头,分词器与策略骨干其余部分保持不变。
论文提出 ProAct 动作分词器训练方法,在重建目标之外增强下游可预测性与鲁棒性,该方法与策略无关且仅用动作数据训练。在 Robomimic、LIBERO、RoboTwin 基准及多种分词器架构上,ProAct 平均提升 rollout 成功率 11.3 个百分点,迁移到视觉语言动作策略和真实机器人操作时分别平均提升 21.8 和 36.7 个百分点。
论文提出 geodex,一个开源 C++20 库并提供 Python 绑定,用于在机器人位形空间的内在几何上进行运动规划。
论文提出以关节运动学作为中间表示,将硬件相关传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋部外骨骼、膝部外骨骼和IMU传感器套件的平地与坡道行走数据上评估,RMSE分别为0.17 Nm/kg(R2=0.79)、0.19 Nm/kg(R2=0.62)和0.15 Nm/kg(R2=0.85),表明仅用开源数据训练的估计器可跨不同可穿戴平台运行。
论文在两个架构族的四个已发布 checkpoint 上观察到世界模型对动作变化敏感度弱、对已验证失败给出成功样预测,并提出 CureWM 方法:从成功演示构造替代动作、在仿真或硬件中执行验证结果,再用得到的失败与存活成功微调已发布模型。
FlashNeRD 通过并行流式架构、可在任意位置接受接触的编码器,以及与解析求解器对象的双向耦合,解决了 Neural Robot Dynamics (NeRD) 加速有限、仅支持预定义接触点、与被操作对象缺乏双向耦合三个局限。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
MimicX 提出一种 policy-in-the-loop 框架,利用执行反馈精化视频驱动的人形动作跟踪训练监督,定位困难过渡与受影响身体部位,并联合调整跟踪目标与 reset 课程。
PhysEvo 提出围绕单一冻结模型的物理递归自改进(RSI)框架,由任务 agent 执行机器人任务、meta-agent 依据轨迹诊断失败并修订工具与技能,全程不更新模型权重也不训练独立动作策略。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
一篇被 2026 IEEE/RSJ IROS 空间机器人研讨会接收的论文提出了一种证据驱动的人-智能体-机器人协作架构,用于深空任务中脱离地面支持的异常分诊。该架构将 Agentic AI 作为有状态协调器,通过分诊状态管理器维护假设与证据溯源,并由移动机器人获取局部证据,已在基于 Reachy Mini 和 Innate MARS 移动机器人的硬件在环原型上验证。
论文研究了 DexUMI 系列外骨骼的两个版本,二者共享相同的机器人指令定义、映射流程和触觉模块类型,但手侧几何不同。改款接口降低了操作者体力负担,在基线版本被机械阻挡的精密抓握中实现了触觉采集,并带来任务相关的接触变化:拧盖任务主要表现为接触位置改变,打开蛋托主要表现为接触有无变化。
论文提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练只需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,Ariadne 能从仅状态监督构建可行路径并泛化到未见过的起终点组合;在高维双臂规划上,其表现与轨迹监督方法和经典规划器相当。该论文已被 NeurIPS 2026 接收,代码已开源。
论文提出CIRRA(Continual Instruction Reconciliation for Robot Agents)双层框架,让家庭机器人在执行任务过程中接收新指令时,保留正在进行的子任务序列作为执行骨架,仅对被修改的片段做语义推理,插入位置匹配的新子任务,从而减少计划歧义、逻辑不一致和冗余执行。
研究团队提出首个在开放、无约束表面上实现闭环自主液滴导航的机器人平台,采用模型强化学习,仅用 50 至 150 次物理实验(视几何复杂度而定)训练策略,无需仿真或解析模型。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 改造为面向四足机器人城市导航的目标条件版本,通过 goal token 注入局部坐标系子目标并重定义人行道导向的可行驶区域合规性。
论文提出一种基于 Vision-Language Models 的上下文感知自适应喷药框架,让机器人结合作物类型、农药类型和天气数据进行空间推理与喷洒决策,并用基于 Model Predictive Path Integral 控制的轨迹跟踪控制器保证导航与喷洒精度。
SAFE 是一种低成本通用传感方案,用两个无源 PVDF 声学传感器加电机本体感知,在不依赖视觉和先验材料知识的情况下实时检测抓取中的滑移与断裂。
一篇 arXiv 综述系统梳理了机器人领域基于因子图与场景图的世界模型如何应对动态环境,围绕表示、构建与更新流程、下游任务利用三方面展开,并重点分析融合两类图的混合模型。综述归纳了常见架构模式,并指出从学习感知到表示层的不确定性传播、动态实体运动可观测性、可扩展的终身维护,以及缺乏数据集与评测协议等开放挑战。全文 34 页,含 7 张表、8 幅图。
WebFovea 是一个视觉网页智能体,在 WebRetriever Challenge 2026 中以 57.0/100 的成绩获得第二名,评测基于 WebRetriever 基准的 Protocol III,要求智能体从入口 URL 出发操作真实网站并返回可验证答案。
论文提出长上下文混合模型机理系列研究 Part 1.1,聚焦全注意力与 SWA 或 GLA、GDN 等线性注意力变体的混合结构。作者观察到上下文扩展中的跷跷板效应,即线性注意力混合模型更受益于长上下文持续预训练,而 SWA 混合模型在长度外推上表现更好,并将其归因于位置归纳偏置差异;同时指出 SWA 混合模型存在短上下文学习陷阱、短窗口倦怠和长窗口惰性。
SGF+(Self Gradient Forcing Plus)为自回归视频生成中的上下文写入与去噪分配独立参数,通过因果注意力保留两者交互,并用原始生成目标联合优化。在仅用 5s rollout 训练的条件下,SGF+ 无需长视频微调即可连续生成长达 24 小时的视频,视觉质量与长时一致性优于所评测的基线,且无需额外视频训练数据或更长训练周期。
论文提出从多向量视觉文档检索器存储的索引中反演还原原始页面,把反演建模为条件文档图像生成。在 ViDoRe v3 基准上,从原始索引反演的页面可恢复 47% 的词和 45% 的敏感 token,用作查询时 98.4% 能把源页面排在首位。
推荐理由:论文用实验量化了多向量文档索引的反演风险,并测试了两种低成本防护的实际效果,做文档检索系统安全评估时可参考其方法。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
GRACE 提出两阶段框架,在压缩预训练视频自编码器的同时保持与预训练 DiT 的兼容:冻结基础潜变量并学习残差潜变量补回强压缩损失的信息,在冻结 DiT 的特征空间中对齐压缩潜变量,再以轻量微调和非对称去噪适配 DiT。
Anthropic 发布 Claude Haiku 5.5,官方跑分逐项超过 GPT-6 Luna,并超越 DeepSeek V4.1 Flash 和 GLM-5.3-Flash 成为新的小模型守门员。
推荐理由:文章列出五处API迁移变动和具体跑分,从Haiku 4.5升级的团队可据此评估改动成本。
阶跃终端将于10月13日在上海举办“Ready Builder One”主题发布会,推出旗下首款大模型原生智能体手机STEPX Neo。STEPX Neo在模型、系统、硬件等方面皆为智能体原生打造,发布会还将公布阶跃终端在生态合作方面的最新进展。
一位创客用 ESP32-S3 制作了一台小型 AM 发射器,接收网络电台流后通过 GPIO 脉冲链生成射频信号,让老式电子管收音机重新发声。发射器采用 3D 打印外壳与支架固定的大间距线圈天线,输出频率为 200kHz 的欧洲长波波段,足以被老式收音机接收。作者指出该发射功率下可能不合规,但认为功率极低不会被察觉。
LWN.net 发布 10 月 8 日周刊,头条内容涵盖内核 bug、Gentoo 的 Chromium 软件包、Rust 智能指针、Sashiko、Charon 与 LAVD 调度器、Python 随机数模块。简讯部分收录 OpenSSH 10.6、RustConf 演讲录像、Rust 1.99.0、Picard 3.0、Zig 0.17 等条目,另有新闻邮件、会议、安全更新与补丁等公告。
Efinix 推出 Sapphire RV64 SoC,这是一款面向 Titanium、Topaz 和 Trion(T20 及以上)FPGA 的可配置 64 位 RISC-V 软核,基于 VexiiRiscv,可配置 1 至 4 个核心,主频最高 400 MHz。
推荐理由:原文列出了主频、缓存、内存支持和外设配置,做 FPGA RISC-V 选型的工程师可据此评估是否替换现有 32 位方案。
Mecka AI 宣布完成 6000 万美元 B 轮融资,由红杉领投,Nvidia、微软风投基金 M12 等参投;TechCrunch 此前报道该轮融资估值接近 5 亿美元。这家公司成立于 2024 年,付钱让人们穿戴身体传感器、用手机记录做咖啡、修车等日常任务,为机器人训练采集人体动作数据,对标 Scale AI、Mercor、Surge 等为 LLM 供数的数据标注公司。
玩家 gavff64 通过自制软件 RNDS-Stream 让 2008 年的 Nintendo DSi 串流游玩 PC 上的游戏,以约 15-20FPS 解码来自 Linux 主机的 MJPEG 流,画面延迟较低但暂不支持音频。该项目是 RubyNDS(基于 Ruby 的 DSi 自制框架)的展示作品,已以 MIT 许可证开源在 GitHub 上。