InterMimicGen 通过自进化动作模仿扩展人形机器人 loco-manipulation
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
研究提出 InterMimicGen,一个自进化动作模仿框架,让人形机器人运动数据与跟踪策略互相增强,用于扩展 loco-manipulation 能力。该框架先整合动捕的人-物交互数据集并重定向为人形机器人参考动作,保留全身协调与灵巧手-物关系,再训练一个基于物理的通用跟踪器在仿真中执行这些参考动作,并通过数据飞轮不断生成并筛选可执行的动作变体。
RV-ICL 是一种免训练方法,将单个演示视频按抓取、释放等子事件构建为从关键帧到短片段的多层只读层级,供 LLM 智能体在规划前读取粗粒度层、执行中按需加载当前子目标片段。基于 RPent,RV-ICL 在 LIBERO-PRO 上将成功率从 92.6% 提升至 96.5%,在 LIBERO-Plus 上从 86.7% 提升至 95.8%。
AffordCraft 从单张 RGB 图像和任务指令出发,通过检索而非生成的方式定位物体与操作部件,从关节资产库中选取匹配条目并拟合到图像,同时保持部件与关节完整。
推荐理由:论文给出资产库规模与成功率的对照数据,做仿真数据构建的团队可据此评估检索式方案相对生成式方法的成本差异。
研究者提出分层规划框架,用 p-cRVAE 学习线性化物理模型的残差修正,从抓取点观测预测 40 步规划时域内的完整布料构型,并嵌入 MPPI 规划器与 MPC 层完成双臂移动机械臂全身控制。
SimForcing 提出仿真引导框架,通过潜空间运动蒸馏与多块仿真条件注入(含条件 dropout)把仿真运动先验迁移到真实域机器人世界模型,推理时无需额外世界模型。
ArtifactArena 是一个开放式平台,让模型在物理接地的软硬件协同设计挑战中工程化构建可运行机器人并在模拟竞技场对战。平台通过文本描述、物理仿真器反馈和游戏数据三种 harness 评测前沿模型的零样本、验证器引导精修与开放式物理设计能力,并用对战 Elo 排名对模型进行基准测试。该框架与赛事基础设施将开放社区持续提交,形成不饱和的开放式智能测试床。
MarvisNav 是一个零样本物体导航(ZSON)框架,把候选节点及其探索状态投影到第一人称视图上,作为带记忆的视觉路径选项,让 VLM 无需额外融合或重排序即可同时评估目标相关性与探索进度。
该研究提出一种人机协同伤员撤离的联合路径规划方法,通过优化伤员交接的 switch points 最小化任务总时间。在多个 1km2 合成环境中,优化策略较纯人工基线缩短平均任务时间 5.3%、较未优化 switch points 的朴素人机协同策略缩短 7.0%,并降低人体能量消耗 17.8%。
Odyssey 提出一个长时程闭环驾驶基准,包含 100 个场景,每个场景由 100 秒 nuPlan 驾驶日志重建,以保留导航操作与交通交互上下文。基准用显式标准定义(SD)地图路线替代方向指令,并引入 SD Route Compliance、Pre-Lane Change Score 与 RouteDS 指标评估规划器路线遵循与变道准备能力。基准代码与适配后的基线将公开发布。
该研究提出二维分类学,沿"意识对象"与"意识分布"两个轴区分 Mutual Awareness、Shared Situational Awareness 与 Team Situational Awareness,指出三者构成包含层级而非同义词,分布谱系从完全个体化理解(MA)到完全统一理解(SSA),TSA 居于混合位置。
阿利坎特大学团队提出一种结合多智能体强化学习与神经进化策略的混合方法,自动合成用于自主视觉导航的群体机器人控制器,仅依赖单目相机图像的紧凑神经网络面向低成本资源受限平台。在高保真物理仿真中,采用交叉熵方法训练的控制器探索覆盖率比协方差矩阵自适应进化策略高 36.20%。最佳视觉策略探索性能与依赖距离传感器的传统方法统计相当,平均能耗降低 31.40%。
研究提出用 Quality-Diversity(QD)算法解决开放环境中的机器人抓取操作任务,高效发现多种稳健抓取构型,作为在铰接物体上生成多样化操作轨迹的可靠起点。操作行为的多样性提升泛化与适应能力,支持在持续演化的开放世界场景中有效部署。该工作为 3 页短文,已被 IMOL 2025 接收。
DexForge 提出一种可微物理框架,将人类视频演示转换为高保真机器人轨迹,通过球形高斯物体建模与高斯碰撞检测构建可微仿真器,并结合接触感知的运动学重定向与力感知的动力学重定向。
阿利坎特大学团队提出双卷积变分自编码器(共享解码器)框架,结合域随机化与特征级域适应,用 45225 张仿真图像加 4556 张真实样本对齐两域潜空间,真实室内导航图像分类平均成功率接近 91%,显著优于仅仿真或仅真实数据训练。
作者提出 Inspect Robots,一个用于开发和运行具身智能体评测的模块化开源框架,提供可定制、可复用的物理评测抽象与结果分析能力,并自动化评测的搭建、执行与终止。论文用该框架评测了六个基于前沿语言模型的策略的能力与安全性;该框架发布三个月以来已获得近 100,000 次下载。论文已提交至 CoRL 2026 的 SPAIS Workshop。
GAMBIT 是一种多机器人连续轨迹规划框架,先通过模仿学习选择协调的运动基元,再用强化学习微调策略,并引入带备份轨迹的安全回滚机制保证全程无碰撞。实验中 GAMBIT 显著优于集中式运动规划器和分布式反应式规划器等基线,在连续域内可协调一千多台机器人,规划时延低于几百毫秒。
FAVOR 是面向世界动作模型(WAM)的轻量级验证与恢复框架,将 WAM 行动前预测的未来帧保留为锚点,由 Anchor Verifier 比对观测与锚点及已执行动作以标记破坏任务的偏差,再由 Anchor-Guided Recovery 借助视觉语言模型生成简短纠正指令,让 WAM 在强化指令引导下回到预期未来并继续任务。
VLA-ZO 提出一种快速零阶(ZO)适配框架,通过冻结视觉-语言前缀并复用其条件状态,将适配限制在动作侧,配合调度感知预取隐藏状态传输开销。在 LIBERO 相机视角偏移上,VLA-ZO 在 q=16 和 q=64 时端到端适配时间分别较基线 ZO 缩短 25.59× 和 32.54×,平均任务成功率从不适配的 48.27% 提升至 58.17% 和 63.58%。
该研究通过保持场景不变的指令干预实验发现,当指令要求抓取另一个可见物体时,被评估的 VLA 策略与世界动作模型(WAMs)大多仍抓取场景偏好的原目标。线性探针能准确恢复被修改的指令目标,说明语言已被编码但很少决定目标选择;注意力分析显示指令 token 对动作生成贡献偏弱,目标 token 注意力仍停留在原物体上。
推荐理由:论文用保持场景不变的指令干预,区分任务成功与真正遵循指令,给出一套可复用的诊断方法。
AUTOPILOT 项目将 YOLO 目标检测与 MiDaS 深度感知结合,用于自动驾驶车辆的障碍物感知与定位,并通过透视变换与决策实现路径规划。仿真与实验评估显示,YOLO 与 MiDaS 的组合构成一套稳健的目标检测与深度感知系统。该研究发表于 IEEE ICACTA 2023。
研究者将微型 UAV 的定位栈整体卸载到带 7 自由度机械臂的四足机器人上,由臂端相机检测机载 AprilTag 标记并融合四足自身定位,为裸机 27 g、带标记 42 g 的无人机提供完整 6-DOF 位姿。实验室飞行中外部位姿精度达 12-16 mm,自主飞行与动捕控制相差 2-5 cm。四足主动跟随使跟踪误差从 11.0 cm 降至 6.9 cm。
STC-MPM(Soft Tissue Cutting with the Material Point Method)提出一种软组织切割仿真框架,耦合有限应变变形、历史驱动连续损伤与可配置失效后处理,无需预先插入切口界面即可联合分析切口形成与组织响应。
研究者提出 ACG-Bench 基准,用于评测双臂视觉-语言-动作模型的臂级组合泛化能力,包含 8 个任务族下的 23 个任务-条件对,覆盖 6 个域内条件与 17 个未见组合。
Siyuan Liu 等提出 ControlPed 框架,将轨迹级冲突合成与 3D Gaussian Splatting 结合,生成照片级、运动可控的车-人危险交互场景。
TRABot 是一个基于多智能体的框架,通过运动原子构建、对话生成、运动规划与面部动画四类专用智能体,将语音、面部动画与身体手势整合为连贯响应。系统在物理 G1 人形机器人上部署流式人脸-语音-身体集成系统,结合流式对话音频、音频驱动面部动画与语义规划的身体运动,实现统一实时交互闭环。定量与定性实验显示 TRABot 在自然度、表现力与多模态一致性上取得最佳整体性能。
Ching-Lam Cheng 等提出一种把人类操作视频转成机器人可用数据的方法,通过交互感知接触重建模块结合手物分割与网格级接触预测恢复稠密 3D 接触,并转换为平行夹爪的时序稳定抓取,再用深度感知合成模块保证机器人与物体遮挡的物理一致性。
研究提出 I-BFM,据作者称是首个面向人形物体交互的行为基础模型,用前向后向表征与无监督强化学习学习人形、物体及接触的耦合动力学共享表征,同一策略可按下游任务奖励以潜变量指令执行闭环交互。
Radar2Plan 提出首个面向自动驾驶规划、基于真实世界 4D 雷达数据的开环自车轨迹规划基准,通过统一接口连接传感器编码器、场景表示与规划头。基于 DSERT-RoLL 与 MAN TruckScenes,基准在 12 种天气与光照条件下评测了相机、4D 雷达与 LiDAR 的 7 种组合、4 种规划基线。实验显示 4D 雷达单独即可支撑有竞争力的轨迹规划,并在恶劣条件下保持稳健表现。
提出 Conditional Trajectory Peaks(CTP)单次前向策略框架,联合预测动作块候选、概率质量与轨迹尺度,配合 DAPS 峰值特化与 ETBT 证据门控轨迹信念传递,兼顾多模态行为与跨块一致性。
研究提出用 Clark 成对递归闭式计算接触最大值的矩,替代一阶传播与 Monte Carlo 采样,用于不确定高程图上的风险感知路径规划。在 317 段留出的 rover 路径上,修正后的 Clark fold 将均值中位误差从线性化的 2.3% 降至 0.19%,并在 90% CVaR 上取得所有方法中最低误差,GPU 上单次基准规划仅 5.5 微秒。
提出 Execution-Aligned Progressive Noise(EAPN),在动作块间传播共享噪声轨迹并与实际执行位移对齐、块内建模时间相关性,使生成式机器人策略在异步重规划中从执行一致的生成状态续接而非独立噪声重启。
Aksel Vaaler 等人提出 Adaptive Mean Flow(AMF),一种基于流匹配的模仿学习方法,用于实现平滑且响应迅速的全闭环机器人控制。AMF 采用 Mean Flow(Flow Matching 的加速形式)降低预测时延,并在预测新动作时引入上一步轨迹的腐蚀版本,信噪比随轨迹时间参数递增,从而抑制相邻步之间的大幅变化。
该研究通过线性探针和表征相似性分析(RSA)考察七个 VLA 的激活,发现质量、易碎性、可变形性、摩擦和尺寸等物理属性在几乎所有模态流中都比语义类别、材料、声音和价格等非物理属性更难解码。
MagServo 提出一种分层学习框架,直接利用学习到的隐式磁特征实现鲁棒的 6-DoF 磁伺服控制,无需解析磁模型或显式 Jacobian 监督。该框架通过掩码重建学习抗不确定性磁表征,并结合非线性模型预测控制与局部 Jacobian 求逆的分层控制器。物理实验实现 0.386 mm 与 0.479 度的平均终端误差,并在未见过的磁源配置下无需重训练即保持鲁棒性能。
Recon2Servo 提出一种从 B-mode 图像直接学习图像到运动推断的视觉伺服框架,实现超声探头 6-DoF 控制。框架采用带低秩适配的 DINOv3 编码器与双向关系模块估计当前与目标图像间的探头相对位姿,结合监督相对位姿学习、重建引导闭环自适应与有界残差位姿修正。在公开数据集及 12 名健康志愿者采集的内部数据集上验证了重建体伺服效果,并在人体前臂演示目标视图对齐与动态跟踪。
P3 提出一种基于序列蒙特卡洛的扩散控制框架,在重规划步骤间维护加权候选轨迹群体,通过约束感知加权与重采样在不重训扩散模型的前提下满足测试时约束。理论分析表明重加噪深度控制已保留轨迹的路线稳定性,且保留稀有分离路线所需粒子数远少于从头采样。在迷宫导航任务中,P3 相比重新生成群体或约束优化修正单条采样轨迹的方法规划更快,减少路线切换并提升成功率,且每次重规划所需去噪迭代更少。
研究者在 MuJoCo 中为 Multi-Modal Infant Model(MIMo)扩展了具身照护者模型,可参数化自人体测量数据或按录制的照护者调整尺寸,并支持回放自然的抱持与安抚互动。
该研究系统分析了图像增强对 VLA 后训练的影响,发现在 RL 更新中只增强 critic 模块、同时让 actor 在 rollout 和更新时保持干净输入最关键。
研究提出一种位置感知的状态调度模型,将机器人准入与搬运人员支持、共享电梯、充电和清洁资源耦合,并回放 33,079 条医院配送请求进行评估。在高人力配置场景下,将假设电梯容量从 2 提升到 4,纯人工调度的延迟率从 55.11% 降至 3.18%,超过调度策略差异带来的影响。结果表明机器人通过截止时间准入测试仍可能因人员交接和共享设施延误服务,分析区分了准入、完成与恢复可用三个阶段。
ARISE 框架在 Sophia 人形机器人上打通社会推理与具身表达,整合多模态上下文理解、长期记忆及反应式与主动式交互,将社会意图转化为与语音和机械面部表情协同的机器人原生手势。流式执行在 Sophia 上的评测显示交互质量与具身行为协调性良好,并显著降低时延。