银河通用与清华 LATENT:用不完美人类数据让 Unitree G1 学会网球对打
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
Long-WAM 提出在实时控制约束下扩展因果世界动作模型上下文的模型系统框架,核心发现是访问历史不等于利用历史,更长历史只有在视频基础模型采用自回归预训练时才显著见效。
同一新闻,精选展示《Long-WAM:扩展世界-动作模型上下文的模型系统框架》
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
论文提出感知辅助的高度自适应规划框架CMP-IRRT*,即Channel Mamba PointNet引导的Informed RRT*规划器,用于四足机器人穿越低矮障碍。
论文提出 LLA-MPPI(Look-back and Look-ahead Adaptive Model Predictive Path Integral control),把全身自适应转化为在一组 GPU 批量接触仿真器(物理或结构参数不同)上的选择,用窗口化预测误差选出最能解释近期运动的模型,再由全身 MPPI 规划器在该模型上优化控制,无需离线训练且所选假设物理可解释。
论文提出 ResGAC,一种结合几何导纳控制(GAC)与残差强化学习的人形机器人全身控制器,用于在浮动基座振荡、重力与运动干扰下实现精确的 SE(3) 末端执行器位姿跟踪。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
Long-WAM 提出在实时控制约束下扩展因果世界-动作模型上下文的模型系统框架,核心发现是访问历史不等于使用历史,更长历史只有在视频底座经自回归预训练时才显著见效。
推荐理由:论文用对照实验说明自回归预训练的视频底座才让长历史真正转化为成功率提升,可为世界模型选型提供依据。
BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。
一篇 arXiv 论文提出基于密度函数的分层模型预测控制(MPC)框架,让多台四足机器人仅凭初始与目标位姿协同推动共享物体,无需预计算参考轨迹。集中式 box-level MPC 优化接触力并施加控制密度约束以实现目标收敛与避障,各机器人再解算分布式 robot-level 全身 MPC 跟踪移动接触点。
论文提出 AutodidactWAM,用无需遥操作训练的手部姿态估计加逆运动学从模型生成视频中恢复动作估计,与原生动作配对后仅微调动作相关层。
一项人形机器人全身遥操作研究提出免重定向策略,将原始人体动作在单次前向传播中直接映射为机器人关节指令,消除在线运动学适配带来的时延与物理不可行目标。该方法学习全身运动基元码本,将分布外观测投影到合理运动原型,并从部分输入中恢复全身运动。在 Unitree G1 上结合虚拟现实、光学动作捕捉、文本生成动作与单目视频输入的仿真与硬件实验中,其时延与鲁棒性表现优于基线方法。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
一项面向人形机器人的基准与闭环框架提出语义感知运动与执行感知导航,建模高程图中不明显的危险物与指令执行偏差,并在仿真中评估导航、在 Unitree G1 实体机器人上验证运动策略。结果显示语义输入减少了机器人与高程图难以表征的危险物的接触,抗偏差机制提升了导航成功率。研究指出人形机器人导航需同时评估路线完成度与危险规避。
该 Demo 提出用视觉语言模型(VLM)引导电磁数字孪生在线标定的框架,基于 Unitree G1 机器人与 NVIDIA Sionna,包含两次 VLM 调用:材料分类通过 ITU-R P.2040 将可见材料映射为 Sionna 梯度下降的电导率先验,航点规划依据 RSS 残差标定误差与图像覆盖在线选择下一测量位置。
BRACE 是一个全身运动跟踪方法,能在斜坡地形上跟随平地参考轨迹的同时施加并补偿手部指令力。它通过地形贴合将落足点与根节点抬升至局部表面,并用 wrench 变换解算产生力的手部位移及其引发的质心与压力中心偏移。
Flash-WAM 提出模态感知的步蒸馏框架,针对动作流低噪声区间采用线性梯度缩放参数化、视频流高噪声区间采用保方差参数化,把世界动作模型推理压缩到每个模态单步。
推荐理由:论文给出了动作流与视频流噪声分布不对称的结构性分析,做世界动作模型实时推理的团队可据此选择一致性函数参数化。
Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。
Rolling-WAM 将世界动作模型(WAM)的联合去噪分摊到连续重规划周期,在滑动窗口内以交错噪声等级维护视频-动作块,滚动噪声调度完全去噪即将执行的动作块并部分细化远期块。相比标准联合 WAM,其稳态重规划速度提升 4.5x。在 LIBERO、RoboTwin 和真实 Unitree G1 人形机器人上的评测显示其操作性能具有竞争力。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。
TRABot 是一个基于多智能体的框架,通过运动原子构建、对话生成、运动规划与面部动画四类专用智能体,将语音、面部动画与身体手势整合为连贯响应。系统在物理 G1 人形机器人上部署流式人脸-语音-身体集成系统,结合流式对话音频、音频驱动面部动画与语义规划的身体运动,实现统一实时交互闭环。定量与定性实验显示 TRABot 在自然度、表现力与多模态一致性上取得最佳整体性能。
研究提出 I-BFM,据作者称是首个面向人形物体交互的行为基础模型,用前向后向表征与无监督强化学习学习人形、物体及接触的耦合动力学共享表征,同一策略可按下游任务奖励以潜变量指令执行闭环交互。
提出 PAMORT 多目标强化学习方法,让四足机器人在无专用负载传感器与主动承载机构的躯干安装无边板上运输无固定堆叠纸箱。该方法以偏好向量加权运动与负载稳定性奖励训练基础策略,再训练权重调节器依据本体感觉在线调整偏好,仿真中对未见过的三箱堆叠也取得与单目标基线相当或更优的运输成功率。
研究提出 OCLO,一种不依赖人体运动数据、仅由两个末端执行器目标指令驱动的人形 loco-manipulation 系统,通过解析可达性先验在线生成骨盆高度与躯干姿态,并用 policy-in-the-loop 采样精修。
VAMPS 提出用 MPPI 控制训练可复用机器人策略,无需人类示教,支持仿真迭代训练与真实机器人数据直接训练两种模式。仿真模式下策略热启动 MPPI 并用 IQL critic 更新,学到的运动策略迁移到 Unitree Go2;真实模式在 Flexiv Rizon 10S 上用 Action Chunking with Transformers 离线训练,完成抓取放置与力感知白板擦拭。
AgenticTactileVLA 提出一种执行期监督器,用手指位置和电机力反馈作为本体接触证据,在不使用触觉传感器、不重训练 VLA 的前提下修正抓取实现。
ROOT(Reward Optimization via Observable Trees)框架通过在持久化实验树上做观察引导搜索来发现奖励函数,使学习策略对齐用户指定的具身行为。
论文提出一套人形机器人拉黄包车的全身控制框架,通过特权教师利用车辆状态、交互力和负载属性训练,再蒸馏为仅依赖本体感受历史的学生策略并做强化学习微调。实机上单一策略完成启动、持续拉动、转向与停止,覆盖刚性负载和真人乘客,无需针对负载重新调参即可拖动最高 115 kg 的负载车,且多数负载-速度条件下机器人归一化运输成本低于空载行走。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。