银河通用与清华 LATENT:用不完美人类数据让 Unitree G1 学会网球对打
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
IROS 2026 上,银河通用 GaLbot 团队与清华大学、北京大学、上海启智研究院和上海人工智能实验室提出 LATENT,让 Unitree G1 从 5 名业余球员在 3米×5米区域采集的约 5 小时不完美动作数据中学习网球能力。
推荐理由:文中给出成功率、消融和真机限定条件,读者可据此判断该方法的真实能力边界。
文章对 IROS 2026 进入正式议程的 1933 篇论文做多标签梳理,Robot Learning / Embodied AI 约 809 篇、Navigation / Planning 564 篇、Humanoid / Legged 约 213 篦,指出大模型并没有吃掉机器人学,学习、感知、规划、控制与操作正深度交织。
推荐理由:对1933篇论文的多标签统计给出了各方向的篇数与交叉数据,可据此判断机器人研究的真实重心分布。
IROS 2026 主会于当地时间 9 月 30 日在美国匹兹堡落幕,最佳论文颁给 Yumin Lee、Hyoseok Ju 和 Giseop Kim 的《LT-Mem。
推荐理由:梳理了最佳论文与各专项奖的分布,可看出机器人研究正从展示单一能力转向在真实环境中持续工作。
HuMBLE 提出一种学习框架,从人体运动数据合成可实时操控、鲁棒且拟人的人形机器人步态策略。方法先用强化学习训练全身参考条件策略,再经师生蒸馏得到仅依赖本体感知和平面躯干速度指令的轻量先验策略,随后用多任务强化学习微调,以目标条件任务扩展指令覆盖并用参考引导任务作为风格正则。
论文提出 ResGAC,一种结合几何导纳控制(GAC)与残差强化学习的人形机器人全身控制器,用于在浮动基座振荡、重力与运动干扰下实现精确的 SE(3) 末端执行器位姿跟踪。
论文提出 Workhorse,让机器人从无人参与的人类演示中学习接触密集的全身操作,视觉规划器预测躯干、双腕和双足五个连杆目标,强化学习全身跟踪器在机器人上跟随,两策略在相同人类姿态数据上分别训练且无需重定向。
MimicX 提出一种 policy-in-the-loop 框架,利用执行反馈精化视频驱动的人形动作跟踪训练监督,定位困难过渡与受影响身体部位,并联合调整跟踪目标与 reset 课程。
论文提出 HULK 全身控制框架,用 MPC 预测负载动力学引导强化学习,训练两个教师策略(腕力下跟踪手臂动作、抱持大物体行走),再蒸馏为单一策略,并在仿真与 Unitree G1 上评测。仿真中带屏障函数的教师在每臂 10 kg 负载下前向与横向速度跟踪误差最低,DCM 偏移总量较仅用 MPC 引导强化学习降低 35.7%,腕力教师可承受高达 130 N 的躯干推扰。
IEEE Spectrum 与 Wiley 联合发布由 Noitom Robotics 赞助的白皮书,介绍 HiPHI 数据集:617.5 小时光学动作捕捉的全身人体动作数据,亚毫米级精度,其中 245.7 小时为人与物体交互数据,含同步物体轨迹与网格,并用 FrameNet 语言框架组织动作覆盖范围。
推荐理由:白皮书给出了数据集规模与人机交互数据的组织方式,关注人形机器人数据来源的读者可据此评估其补充价值。
KungfuAthleteBot(KAB)框架在人形机器人上从视频学会高动态技能,并在约 0.7 s 内从任意跌倒中恢复,是已报道的统一策略中最快的恢复速度。该框架构建了由国家级武术运动员视频组成的 KungfuAthlete 数据集,用物理引导的抛物线轨迹修正消除高度漂浮、地面穿透与高频抖动,并以物理驱动的伪低动能(LKE)采样让策略从动力学可行状态初始化。
BAT 提出在线策略切换框架,依据运动上下文在耦合与解耦的全身 RL 控制器间动态选择,采用 OpVQ-VAE 与 OpHRL 两个切换预测器并由 Token-Familiarity Router(TFR)仲裁。在已见长时程运动组合上成功率 85.2%,未见运动上保持 71.3%,并在 Unitree G1 人形机器人上完成零样本部署。
LHM-Humanoid 通过学习"可恢复"的周期交接状态,让物理仿真人形在单次不间断运行中反复完成取物—搬运—放置,在 350 个覆盖四类房间的杂乱布局上取得比端到端 RL、分层 RL 及既有物理人机交互方法更成功、更稳定的长时程运动表现。
一套三阶段离线指令生成框架在悬挂式双足机器人上复现了 Vicon 系统记录的人体行走与下蹲动作,关节角度重复试验的平均 RMSE 低于 7°、标准差低于 0.33°。框架先用 SDRE 控制推导参考力矩轨迹,再经参数化优化转为受电机转速与加速度限制的梯形关节速度指令,最后由 PID-LQR 补偿修正。各报告情形下关节角度与力矩轨迹的最大 RMSE 和标准差均低于 MPC 与 IPSO-PID。
R2RI 是首个专为机器人间交互(RRI)任务设计的数据集,包含多款人形机器人基于真实人类社交行为建模的交互场景,提供各机器人机载传感器的第一人称视角与外部固定相机的第三视角。数据集涵盖 Event 与 RGB 两种模态,规模超过 6.5M 帧、约 5000 段视频,帧率达 120 fps,已公开发布全部任务与模态的数据及标注,并对比了两种模态在多项感知与交互任务上的表现。
论文提出 QF3(Fast Flow RL with Filtered Q-Gradients),一种在线离策略 RL 算法,通过 flow matching 加上 critic 的动作梯度、经一步预测反向传播来训练流策略,且只将 critic 梯度施加于接近回放动作的那些动作维度。
推荐理由:论文给出相对 FPO++ 的 10x 训练加速和零样本上机结果,可评估该算法是否值得在人形运动控制任务中试用。
针对轮式移动底盘人形机器人(含移动底盘、升降柱与双臂)难以直接套用腿部人形重定向方法的问题,研究提出一种任务条件化框架,将重建的人体动作分配给底盘、升降与手臂职责后再做机器人侧实现。部署适配器以 50 Hz 输出指令,采用静止底盘检测、死区与斜率滤波、时间一致回放缩放以及线性与角速度独立增益。评测涵盖人体导出的任务空间对比、无策略仿真回放与真机定性执行。
Humanoid Horizon 提出统一策略框架,用 Parallel Training、Dynamic Starting 与 Reward Gating 三项机制解决长时域全身 loco-manipulation 中的 easy-reward bias 与 catastrophic forgetting 问题。
iGPC 将 Generative Pretrained Controller(GPC)从通用人体运动扩展到类人机器人与环境的全身交互,通过场景可供性线索与特权状态信息训练交互专家,再由机载传感器观测的学生策略蒸馏接触、抓握与推动技能。实验在多个全身交互任务上验证,大规模生成式人体运动先验可作为类人机器人在接触密集真实环境中学习可部署策略的有效基础。
论文提出 AutodidactWAM,用无需遥操作训练的手部姿态估计加逆运动学从模型生成视频中恢复动作估计,与原生动作配对后仅微调动作相关层。
GENESIS-Handover 利用 VLM 图像生成产生多种任务特定的手-物交互假设,并实时与观测到的人类手部姿态匹配,以推断最合适的递物配置。在 12 名参与者、5 组任务-物体配对的用户研究中,83.3% 的参与者认为该方法比先前的 state of the art 具有更好的任务理解能力。
一项人形机器人全身遥操作研究提出免重定向策略,将原始人体动作在单次前向传播中直接映射为机器人关节指令,消除在线运动学适配带来的时延与物理不可行目标。该方法学习全身运动基元码本,将分布外观测投影到合理运动原型,并从部分输入中恢复全身运动。在 Unitree G1 上结合虚拟现实、光学动作捕捉、文本生成动作与单目视频输入的仿真与硬件实验中,其时延与鲁棒性表现优于基线方法。
BiGym 2.0 将 BiGym 适配到 Unitree G1,覆盖 20 项家庭任务,使用统一的全身控制器进行演示与评测,每项任务提供 60 条人类虚拟现实演示,含同步多相机视角和全身执行记录。
MobileVISTA 是一个数据生成框架,把在标准位姿下采集的演示转化为带位姿扰动的训练数据,同时增强自我中心视觉观测并重定向动作以补偿基座位姿变化。
一项面向人形机器人的基准与闭环框架提出语义感知运动与执行感知导航,建模高程图中不明显的危险物与指令执行偏差,并在仿真中评估导航、在 Unitree G1 实体机器人上验证运动策略。结果显示语义输入减少了机器人与高程图难以表征的危险物的接触,抗偏差机制提升了导航成功率。研究指出人形机器人导航需同时评估路线完成度与危险规避。
BRACE 是一个全身运动跟踪方法,能在斜坡地形上跟随平地参考轨迹的同时施加并补偿手部指令力。它通过地形贴合将落足点与根节点抬升至局部表面,并用 wrench 变换解算产生力的手部位移及其引发的质心与压力中心偏移。
研究者提出改进的幻影装置 Physical Twins,可在真实世界中对物理交互算法进行 RL 类测试,无需 IRB 审批与真人受试者。该装置除复现肩部球窝运动外,还渲染肩胛与前伸/后缩运动,并演示 Franka Panda 机械臂感知关节极限、完成 ADLs 与 pHRI 任务。
Zhuo Lin 等人提出 InterEvolve,在不重新训练的前提下让控制器通过测试时进化完成未训练过的人形 loco-manipulation 任务。方法包含 object-aware forward-backward 行为基础模型,以及由 LLM 智能体结合执行反馈与技能库修订结构、数值优化器调节常数的奖励程序。
PredActor 是一种预测式动作扩散策略,仅依赖本体感知历史即可联合预测动作与内部未来状态轨迹,通过 classifier-free guidance 强化文本条件动作、classifier guidance 将未来状态引向测试时目标,无需动作参考跟踪器或特权全身状态。
PACE 提出交互式人格引导流水线,让 Ameca 人形机器人通过用户问答动态合成定制化、有心理学依据的人格,并编译为多视角维度的结构化人格提示,驱动多模态表达行为。实证 HRI 评估对比通用基线,考察动态生成人格对用户信任、拟人化感知、人格一致性、个人相关性与交互质量的影响。
RPL 提出两阶段训练框架,先用特权高度图观测训练地形专家策略,再蒸馏为基于多深度相机的 transformer 策略,实现人形机器人在复杂地形上的多方向鲁棒运动。
TRABot 是一个基于多智能体的框架,通过运动原子构建、对话生成、运动规划与面部动画四类专用智能体,将语音、面部动画与身体手势整合为连贯响应。系统在物理 G1 人形机器人上部署流式人脸-语音-身体集成系统,结合流式对话音频、音频驱动面部动画与语义规划的身体运动,实现统一实时交互闭环。定量与定性实验显示 TRABot 在自然度、表现力与多模态一致性上取得最佳整体性能。
研究提出 I-BFM,据作者称是首个面向人形物体交互的行为基础模型,用前向后向表征与无监督强化学习学习人形、物体及接触的耦合动力学共享表征,同一策略可按下游任务奖励以潜变量指令执行闭环交互。
ARISE 框架在 Sophia 人形机器人上打通社会推理与具身表达,整合多模态上下文理解、长期记忆及反应式与主动式交互,将社会意图转化为与语音和机械面部表情协同的机器人原生手势。流式执行在 Sophia 上的评测显示交互质量与具身行为协调性良好,并显著降低时延。
研究提出 OCLO,一种不依赖人体运动数据、仅由两个末端执行器目标指令驱动的人形 loco-manipulation 系统,通过解析可达性先验在线生成骨盆高度与躯干姿态,并用 policy-in-the-loop 采样精修。
CoDance 提出一个从视频学习反应式、柔顺人机人形交互的框架,以双人舞蹈为场景,让机器人与移动伙伴协调步伐并保持双手持续接触。给定一段双人舞视频,CoDance 将动作重定向为机器人参考与移动伙伴,并引入多连杆柔顺增强方法,在双手施加结构化力把运动学演示转化为力感知训练数据。
提出一种上下文贝叶斯优化框架,用于分层控制系统中质心预测控制器与全身控制器的联合参数学习,保留任务性能、实现质量与控制努力的独立观测,并用相关多输出高斯过程建模。在不同箱体质量下的人形机器人推箱移动操作任务中,该方法在训练与适应阶段均取得所比较基线中最低的平均经验遗憾。
该研究提出一种两阶段混合逆运动学框架,用于求解人形机器人 7-DoF 偏置冗余机械臂的逆运动学:先用近似解析模型枚举候选关节解,再用轻量学习预测器结合 split-conformal prediction 给出校准难度上界排序种子,最后用 Levenberg-Marquardt 在完整运动学模型上精化。
论文提出一套人形机器人拉黄包车的全身控制框架,通过特权教师利用车辆状态、交互力和负载属性训练,再蒸馏为仅依赖本体感受历史的学生策略并做强化学习微调。实机上单一策略完成启动、持续拉动、转向与停止,覆盖刚性负载和真人乘客,无需针对负载重新调参即可拖动最高 115 kg 的负载车,且多数负载-速度条件下机器人归一化运输成本低于空载行走。
提出 Similarity-guided LoRA-PNN,用渐进式神经网络策略结合轻量 LoRA,在顺序任务流中让人形全身控制器持续学习而不遗忘已掌握技能。基于动态时间规整与最优传输的两级运动相似度决定复用哪个先验技能并分配新容量,在六个顺序学习技能类别上取得最佳前向迁移 0.125 与最高平均准确率,节省最多 94.5% 可训练参数和 40.8% 训练时间。
Figure 发布 Helix 2.5,机器人在 30 个未采集过数据的湾区家庭中零样本完成整理客厅、叠毛巾、铺床三项全身长时程任务。对照实验显示,在架构、超参与下游数据固定的前提下,仅 Index 预训练就将零样本成功率从 9% 提升到 56%;相比 Helix 02,Helix 2.5 用一半的任务数据达到同等成功率。
推荐理由:原文给出 Index 预训练与从零训练的对照实验,9% 到 56% 的差距可帮助判断人类数据预训练对零样本泛化的实际贡献。